作者proud (hc)
看板Python
标题[问题] 爬虫出现问题
时间Tue May 24 12:51:40 2016
想请问code没问题下
出现 HTTP Error 500: server error
这样状况是什麽问题?
爬的网页可以开启
用本地IP去爬也是出现这个error
也排除IP问题
想请问有什麽解决法?
code片段如下 抓的是奇摩股票新闻
stockList = [line.rstrip() for line in open('test1.txt')]
for count in range(100000000):
t1 = time.time()
timeCount = 0
for stockNum in stockList:
d = feedparser.parse('
http://tw.stock.yahoo.com/rss/s/%s' % stockNum)
lens = len(d.entries)
print lens
for newsNum in range(lens):
print d.feed.title
title = d.entries[newsNum].title.encode('utf-8')
print title
rTitle = title.replace('/', '.')
link = d.entries[newsNum].link
req = urllib2.Request(link)
print req.__doc__
if not req.__doc__:
continue
content = urllib2.urlopen(req).read()
save = open('./database/%s/%s.news' % (stockNum, rTitle), 'w')
save.write(content)
save.close()
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 101.15.146.112
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/Python/M.1464065502.A.5CB.html
1F:→ secondDim: google http 50005/24 13:16
有找过才上来问,很多是说设定网际网路选项 http错误讯息,但我是用Mac.. 原本抓好
好突然出现这问题@@
※ 编辑: proud (101.15.146.39), 05/24/2016 13:41:32
2F:→ uranusjr: 500 代表 server 自己坏了, 你没办法解决05/24 16:59
3F:推 aweimeow: 你试试看把你存取网页的 UA 塞进去05/24 17:09
4F:→ aweimeow: 之前有碰过因为 UA 不对就故意吐 500 给我的 server05/24 17:09
5F:→ daniel1205: header , cookie 看一下05/24 20:04
请问terminal要怎处理?
※ 编辑: proud (111.240.33.176), 05/24/2016 22:17:10
我curl -v 一下 connection : close
※ 编辑: proud (111.240.33.176), 05/24/2016 22:21:03
6F:→ aweimeow: 话说你不把 code 贴出来大家要怎麽 debug05/25 13:18
※ 编辑: proud (111.240.30.76), 05/25/2016 21:52:26
写的不好还请指教,github不太好意思。手机看会失真
※ 编辑: proud (49.214.149.138), 05/25/2016 22:01:35
7F:推 aweimeow: 我刚刚实验了一下,是 UA 的问题 05/25 22:43
8F:→ aweimeow: 看看这段吧,你能理解问题出在哪05/25 22:48
谢谢aweimeow!
10F:推 kanggy: 谢谢 aweimeow 分享, 学习了 :P05/26 08:54
11F:→ billy0131: 这种防爬虫的方法到底有什麽用....05/27 11:37
12F:→ s860134: 防君子不防小人阿 最差最差你模仿浏览器还是能爬05/27 22:13
13F:→ s860134: 最简单就是 user-agent, host 比较复杂就 cookie 05/27 22:15
※ 编辑: proud (101.12.147.62), 05/30/2016 19:38:06