作者granly (granly)
看板Python
标题[问题] 新手请教爬虫爬动态网页
时间Sat Mar 4 02:39:34 2017
各位好,本身没学过什麽程式,
前阵子对爬虫起了兴趣,利用下班之余学习如何用PYTHON写爬虫,
但遇到爬取动态网页遇到了瓶颈,爬文之後发现有两种解法
1.用Selenium模拟浏览器後,
操作一些动作後对网页最後的样子抓源码,
在对需要的数据用BeautifulSoup操作抓取
2.分析网页是如何对JAVASCRIPT等等请求数据(此部分不太确定,如有错误再请指导)
,然後再对放数据的js做get、post等等操作,後续如1
秉求着学习就要每种都要学会的态度,
想请版上的神人们给点指导...!
目前
1.是比较有头绪的,这样的流程是否理解正确呢?
2.的部分则是完成看不懂监测到的那一堆东西...
像是此网页:goo.gl/P3
可贷额度试算最後试算出来数字该如何抓取呢?
以上的部分再请各位指出错误与指导了谢谢!
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 118.166.47.155
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/Python/M.1488566376.A.FF7.html
1F:推 vi000246: 可以用fiddler观察封包 模拟一样的表头送出03/04 11:49
2F:→ granly: 不太懂v大的意思...是否可以站内line请教呢?03/04 13:41
3F:→ s860134: 你理解没错,但最後的例子是你的浏览器算出来的 没传输03/04 18:22
4F:→ s860134: 自然你甚麽东西都抓不到03/04 18:23
6F:→ vi000246: 他说的应该是可贷额度试算那个页签03/04 18:30
7F:→ s860134: 原来如此,表头的话不是用浏览器就看的到了? 03/04 18:55
8F:→ granly: 对,会输入两次个人资料後会有额度资料03/04 19:05
9F:→ granly: 目前是用requests,创一个session(),post两次,但抓到的03/04 19:23
10F:→ granly: 源码还是没有数字03/04 19:23
12F:→ zerof: r"\.monitor_counter\d?'\)\.html\('(.+)'\);"03/04 22:20
※ 编辑: granly (27.246.167.199), 03/06/2017 09:44:06