作者coeric ( )
看板Python
标题[问题] 半桶水请问一个爬虫post问题
时间Thu Dec 15 13:34:43 2016
单纯想爬保险公司营业处的资讯
为何传回来的都是空值?
import urllib,urllib2
import re
from time import *
url="
https://www.nanshanlife.com.tw/NanshanWeb/branches/query"
request = urllib2.Request(url)
request.add_header("User-Agent","Mozilla/5.0 (Macintosh; Intel Mac OS X
10_11_2) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/47.0.2526.106
Safari/537.36")
request.add_header("Referer","
https://www.nanshanlife.com.tw/NanshanWeb/branches/74")
form_data = {
"county":'台北市',
"town":'信义区'
}
form_data = urllib.urlencode(form_data)
response = urllib2.urlopen(request,data=form_data)
html=response.read()
print html
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 175.111.41.15
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/Python/M.1481780087.A.051.html
1F:推 orafrank: 对阿 到底少了什麽 ? cookie? 12/15 15:03
4F:→ sky800507: 抓下来是json格式唷 12/15 21:54
5F:→ coeric: 感谢各位大大.............少了一行"Content-Type" 12/15 22:37
6F:→ coeric: 之前在爬全家店舖时,也发生过类似的状况.. 看得到 吃不到 12/15 22:54
7F:→ coeric: 少一行Referer......... 12/15 22:54
8F:→ coeric: 那是否每次乾脆都把Request Headers的讯息都附上去? 12/15 22:55
9F:推 shadowjohn: 有的网站就是会龟毛的检查某一页header 12/16 15:51
10F:→ shadowjohn: 至少能挡掉一堆不会爬的 12/16 15:51
11F:推 shadowjohn: 之前就有网站检查 HTTP_ACCEPT_LANGUAGE 12/16 15:53
12F:→ shadowjohn: 你没附抓到三次就ban整天... 12/16 15:53
13F:→ shadowjohn: 尽可能完整的伪造成浏览器的格式 12/16 15:54
14F:→ shadowjohn: 直接cut curl的内容来改也行 12/16 15:54
15F:→ coeric: 所以 我就是那个被挡在外面的............XDDDD 12/16 22:23