Python 板


LINE

※ 引述《orafrank (法兰克 )》之铭言: : 抓取新闻列表搞定了 : 但是单独进入个别新闻页面时 抓取就被拒绝了 : 各种hearder都加了,还是被拒绝。 : 怎麽办呢? CODE如下 : import requests : import csv : from bs4 import BeautifulSoup : import urllib2 : import urllib : import cookielib : headers = {"User-Agent":"Mozilla/5.0 (Windows NT 6.1) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/55.0.2883.87 Safari/537.36"} : headers["Accept"]="text/html,application/xhtml+xml,application/xml;q=0.9,image/webp,*/*;q=0.8" : headers["Referer"]="https://tw.news.yahoo.com/sports/" : headers["Accept-Encoding"]="gzip, deflate, sdch, br" : headers["Accept-Language"]="zh-TW,zh;q=0.8,en-US;q=0.6,en;q=0.4,ja;q=0.2" : headers["upgrade-insecure-requests"]="1" : payload1 = {} : urllib2.install_opener(urllib2.build_opener(urllib2.HTTPCookieProcessor())) : cookie = cookielib.CookieJar() : opener = urllib2.build_opener(urllib2.HTTPCookieProcessor(cookie)) : url="https://tw.news.yahoo.com/%E4%B8%8D%E9%87%8D%E5%BB%BA%E4%BA%86-%E5%85%89%E8%8A%92%E5%8F%AF%E8%83%BD%E6%8B%9B%E6%94%AC%E5%B7%B4%E6%8F%90%E6%96%AF%E5%A1%94-072000742.html" : res = requests.post(url, headers=headers, data=payload1, stream=True) : res.encoding='utf-8' : #print "res text = " + res.text : soup = BeautifulSoup(res.text, "html.parser") : print "url is " + url : item = soup.find('div') : print soup : print headers : 得到的结果 : url is https://tw.news.yahoo.com/%E4%B8%8D%E9%87%8D%E5%BB%BA%E4%BA%86-%E5%85%89%E8%8A%92%E5%8F%AF%E8%83%BD%E6%8B%9B%E6%94%AC%E5%B7%B4%E6%8F%90%E6%96%AF%E5%A1%94-072000742.html : <!DOCTYPE HTML PUBLIC "-//W3C//DTD HTML 4.01 Transitional//EN" "http://www.w3.org/TR/html4/loose.dtd"> : <html> : <head> : <meta content="text/html; charset=utf-8" http-equiv="Content-Type"> : <title>Access Denied</title> : </meta></head> : <body> : <h1>Access Denied</h1> : <!-- Tue, 20 Dec 2016 03:43:52 GMT ncache5.global.media.sg3.yahoo.com (squid/2.7.STABLE9) --> : </body></html> : {'Accept-Language': 'zh-TW,zh;q=0.8,en-US;q=0.6,en;q=0.4,ja;q=0.2', 'Accept-Encoding': 'gzip, deflate, sdch, br', 'Accept': 'text/html,application/xhtml+xml,application/xml;q=0.9,image/webp,*/*;q=0.8', 'upgrade-insecure-requests': '1', 'Referer': 'https://tw.news.yahoo.com/sports/', 'User-Agent': 'Mozilla/5.0 (Windows NT 6.1) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/55.0.2883.87 Safari/537.36'}:P 刚才测了一下你写的code 问题是不大 不过可以改几个地方 1、headers["Accept-Encoding"]="None"; gzip还要解,没啥必要 2、url 不要抓 https 的,改成 http 这样应该可以跑 https://postimg.org/image/n18wn8q69/ https://postimg.org/image/wzygngozl/ --



※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 140.134.48.253
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/Python/M.1482282295.A.9CB.html ※ 编辑: shadowjohn (140.134.48.253), 12/21/2016 09:05:40
1F:推 orafrank: 感恩 後来发现request.post 改成request.get就可以了。 12/21 09:40







like.gif 您可能会有兴趣的文章
icon.png[问题/行为] 猫晚上进房间会不会有憋尿问题
icon.pngRe: [闲聊] 选了错误的女孩成为魔法少女 XDDDDDDDDDD
icon.png[正妹] 瑞典 一张
icon.png[心得] EMS高领长版毛衣.墨小楼MC1002
icon.png[分享] 丹龙隔热纸GE55+33+22
icon.png[问题] 清洗洗衣机
icon.png[寻物] 窗台下的空间
icon.png[闲聊] 双极の女神1 木魔爵
icon.png[售车] 新竹 1997 march 1297cc 白色 四门
icon.png[讨论] 能从照片感受到摄影者心情吗
icon.png[狂贺] 贺贺贺贺 贺!岛村卯月!总选举NO.1
icon.png[难过] 羡慕白皮肤的女生
icon.png阅读文章
icon.png[黑特]
icon.png[问题] SBK S1安装於安全帽位置
icon.png[分享] 旧woo100绝版开箱!!
icon.pngRe: [无言] 关於小包卫生纸
icon.png[开箱] E5-2683V3 RX480Strix 快睿C1 简单测试
icon.png[心得] 苍の海贼龙 地狱 执行者16PT
icon.png[售车] 1999年Virage iO 1.8EXi
icon.png[心得] 挑战33 LV10 狮子座pt solo
icon.png[闲聊] 手把手教你不被桶之新手主购教学
icon.png[分享] Civic Type R 量产版官方照无预警流出
icon.png[售车] Golf 4 2.0 银色 自排
icon.png[出售] Graco提篮汽座(有底座)2000元诚可议
icon.png[问题] 请问补牙材质掉了还能再补吗?(台中半年内
icon.png[问题] 44th 单曲 生写竟然都给重复的啊啊!
icon.png[心得] 华南红卡/icash 核卡
icon.png[问题] 拔牙矫正这样正常吗
icon.png[赠送] 老莫高业 初业 102年版
icon.png[情报] 三大行动支付 本季掀战火
icon.png[宝宝] 博客来Amos水蜡笔5/1特价五折
icon.pngRe: [心得] 新鲜人一些面试分享
icon.png[心得] 苍の海贼龙 地狱 麒麟25PT
icon.pngRe: [闲聊] (君の名は。雷慎入) 君名二创漫画翻译
icon.pngRe: [闲聊] OGN中场影片:失踪人口局 (英文字幕)
icon.png[问题] 台湾大哥大4G讯号差
icon.png[出售] [全国]全新千寻侘草LED灯, 水草

请输入看板名称,例如:Soft_Job站内搜寻

TOP