作者busystudent (busystudent)
看板Python
标题[讨论] 关於多执行绪爬虫的观念与问题
时间Mon Apr 25 19:17:42 2016
hi 最近几天都在板上询问爬虫的问题,很感谢大家的指点,想再多问一点延伸的问题,关於多执行绪爬虫的观念。
我这几天爬虫下来,觉得我的程式码除了没用使用函式外,执行的效率真得不够好,我要抓的网页都超过1000个,执行下来时间与效率都不佳。
上stackoverflow发现有介绍多执行绪,感觉这是不错的解决方法,想跟大家打听哪里有适合初学者的相关知识可以查询,我这几天找寻下来的结果,总感觉有一定的门槛在。
另外很好奇多执行绪可以用於我的程式码吗?像是我有这种
links = ['
http://www.diigo.com/user/tony_swann/' + x for x in tag_list]
组合式的式子
stackoverflow上关於多执行绪的文
http://goo.gl/iYi8lJ
--
Sent from my Windows
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 1.172.95.247
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/Python/M.1461583065.A.2C5.html
※ 编辑: busystudent (1.172.95.247), 04/25/2016 20:36:27
1F:→ Neisseria: 慢慢爬比较好,爬太凶有可能被防火墙挡 04/25 20:36
2F:→ busystudent: 同意,我被挡好几次,只好设定随机1秒或5秒 04/25 20:57
3F:→ MOONY135: 端看你想干嘛 有必要做到每次都要全部都重抓吗 04/25 23:22
4F:→ MOONY135: EX 爬二手交易版只需要每天UPDATE一天的量就好了 04/25 23:23
5F:→ MOONY135: 全部都要重抓当然很花时间 有没有不需要重抓的部分 04/25 23:23
6F:→ MOONY135: 每次抓都会有的东西 那不如直接存在资料库里 04/25 23:24
7F:→ Neisseria: 同意 M 大的看法,同样的东西不需要一直重覆抓 04/26 08:40
8F:→ busystudent: 了解,看来我有不少地方可以修改 04/26 14:13
9F:推 aaa7513231: scrapy 用这就可以跑多网页爬虫了 04/26 23:42
10F:→ busystudent: 有听过scrapy下次来试试 04/27 00:22
11F:推 tommy87166: 用thread会有全局锁的瓶颈,可以用multiprocessing 05/01 04:52
12F:→ tommy87166: 的process pool来跑 05/01 04:52