作者DaKyu (丹明)
看板Python
标题[问题] 卦板用request取得之原始码不合
时间Fri Jan 26 17:28:50 2018
大家好,
我目前刚开始藉Su Billy大大的简单爬虫教学video初学python爬虫
遇到有个小问题,
就是我用request抓卦板的原始码时
-
res = request.get('
https://webptt.com/cn.aspx?n=bbs/Gossiping/index.html')
print(res.text)
-
印出的原始码跟实际卦板网页的原始码对不上,
而是显示像是PTT入口页面的内容 如下图
https://imgur.com/gmTQFY9
BUT!
我用Salary, Tech_job跟表特等其他板测试, 却都没有问题@@
想请问卦板的内容有何特殊之处吗?
我对前端的html和CSS等语言完全不熟, 只学过基础的python
望大家指教,谢谢板友Orz
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 140.112.234.94
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/Python/M.1516958933.A.B85.html
※ 编辑: DaKyu (140.112.234.94), 01/26/2018 17:30:43
1F:→ uranusjr: Session 问题, 你 request 里面没按过那个 18 禁按钮 01/26 17:31
谢谢u大提醒! 有google到相关解法了, 真的很谢谢你~~
※ 编辑: DaKyu (140.112.234.94), 01/26/2018 17:54:54
2F:→ leo850611: 貌似模拟Google爬虫可绕过那个按钮 01/27 17:14
3F:推 penut85420: 可以用Selenium去点那个按钮 01/29 14:25