作者xyz6206a (xyz6206a)
看板Python
标题[问题] 使用selenium爬虫被侦测为机器人
时间Thu Jun 30 11:58:45 2016
各位前辈大家好!
我日前使用selenium写爬虫时
遇到网页侦测为机器人而跳出
需要写认证码阻挡,而我自己使用
time.sleep()去延迟下载时间
好像也没法阻止机器人侦测
请问这个原因是?
请问一下有其他解决方法吗?
下图为我遇到的状况
http://imgur.com/CyfWI5k
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 140.112.25.106
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/Python/M.1467259128.A.3AA.html
1F:→ Neisseria: 改 user agent 看看? 06/30 12:07
2F:→ Neisseria: 我笨了,不好意思 = =... 06/30 12:08
3F:→ yf9000555: 如果那个网站当初设计,是采用同Ip请求次数来阻挡的话 06/30 12:38
4F:→ yf9000555: ,刚好你电脑为浮动IP的话,用系统命令断线重连就可以 06/30 12:38
5F:→ yf9000555: 避开了 06/30 12:38
6F:→ xyz6206a: 这个网站要求一定要用学校IP,所以不知道是否可以用断线 06/30 12:44
7F:→ xyz6206a: 方式 06/30 12:45
8F:→ cybelia: 原po要爬的站跟你们学校的合约,确定是允许「使用软体 06/30 13:03
9F:→ cybelia: 大量下载」的吗? 06/30 13:03
10F:→ IAMPF: 你也可以去找大量的proxy或是用tor来避开这个问题 06/30 13:17
11F:→ xyz6206a: 其实我也不确定是否允许大量下载这是老师的计画 06/30 15:41
12F:→ tj386: 换个作业系统看看 少用win 06/30 18:43
13F:→ ripple0129: 看有没有猜captcha次数限制,没的话写OCR来破解,这 06/30 22:21
14F:→ ripple0129: 个captcha看起来不难解 06/30 22:21
15F:→ xyz6206a: r大是指要用辨识程式去辨别吗? 07/04 19:20