作者neil987 (R5大小姐-EX人品崩坏)
看板Python
标题Re: [问题] 爬虫post&header
时间Sat Sep 23 22:04:20 2017
靠杯 文章打一半被PTT吃掉 重打= =
爬虫以我的观点来看,就是网站资料的逆向工程
所以搞清楚网站资料的一些细节是很重要的
----
以原PO的网页范例来说,原PO想爬的是某个表单送出之後的资料
那第一个重点是,我们到底对哪个网页送出了我们的表单内容
所以我们先来观察看看吧
https://i.imgur.com/67whTKj.png
从这张图我们可以看到,每次我送出查询资料时,他都会把资料送给
https://www.taiwanmobile.com/cs/public/storeAction.do?method=searchLBS
这个网站,所以目标搞清楚了,再来是思考需要送什麽资料
於是需要送什麽资料同一张图也看的到
搞清楚这两点之後,就可以先做第一次测试
res = requests.post(url, params = form_data)
print res.text
发现结果:
https://i.imgur.com/izxeW4Z.png
耶,有东西了
所以我们可知,这查询网页没有检查其他的东西
原PO可以观察chrome同页面的response
会发现他回传的内容就是我们爬虫爬到的
然後,建议原PO可以了解一下什麽是json格式
例如这网址回传回来的资料就是json格式的
那再利用json做处理就好
----
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 125.230.89.213
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/Python/M.1506175464.A.DBD.html
1F:推 coeric: 推 台哥大是给json 棒棒的 09/23 22:40
2F:→ neil987: 我其实还遇到一个点是我抓不到这网站给的jsessionid 09/23 23:18
3F:推 vi000246: 你把cookie清掉 这个request会回传新的sessionid 09/24 02:36
4F:推 unhumanWu: 感谢大大,另外想问一下这方面有没有建议的书或网站 09/24 08:44
5F:→ unhumanWu: 可以参考的,感恩~ 09/24 08:45
7F:推 unhumanWu: 推 09/24 21:47
8F:推 togetherhoo: 原原po加油 09/24 23:30