作者royt (lulu)
看板Python
标题[问题] 爬虫下拉式选单xml资料撷取
时间Tue May 2 22:49:25 2017
目标是登入网页帐密,里面有两组下拉选单
其中一组是年度,每个年度有数组资料
资料内容类似问卷
要把每笔资料输出成xml
点选不同笔资料url不变
我是用request登入
但不知道怎麽用request去抓选单的选项
目前想到用selenium find_element_by_name select_by_value
取得选单选项,再把变数用
f=requests.session()
r=f.get(url, params=variable)
的方式抓每笔资料
但selenium的速度慢很多
不知道有没有更直接的做法?
-----
Sent from JPTT on my Samsung GT-I9300.
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 114.136.240.162
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/Python/M.1493736570.A.F8B.html
1F:→ s860134: 要看他网页是怎麽做的,如果是用 js 动态的读取资料05/04 08:18
2F:→ s860134: 那你就要想办法去模仿发他发的request,转成你的 code05/04 08:19
3F:→ s860134: 如果是资料一开始就在 htmlsource 里面的话,随便爬罗05/04 08:20
资料不在html里,请问要从他的code哪部分知道request的方法呢?
※ 编辑: royt (114.136.17.213), 05/05/2017 15:00:15
4F:→ twkoci: 用chrome dev tools可观察request body 05/05 16:12
5F:推 david31408: 所以要会读xml ? html5? 还是CSS (对不起 超新手 :( 05/16 11:19