作者peace9527 (谢谢你9527)
看板Python
标题[问题] Selenium与BeautifulSoup有什麽不同?
时间Mon Feb 15 18:04:39 2016
各位前辈大家好
目前正在学习python来当网路爬虫
之前用BS成功抓取table的资料
也知道BS的强大
後来发现BS还是有他的瓶颈
因为他不是浏览器 他无法帮我们选取按钮或触发AJAX
後来爬文後发现selenium好像可以实现这些行为
透过触发後 就可以获得BS原本无法得到的资讯
例如要onclick後才会出现的网址或按钮
我只要用selenium去触发onclick 就可以获得网址
然後再用BS去分析这个网址
看起来我自己好像已经讲完了
但其实我不是很肯定我的理解对不对
希望各位大神能帮我解答 看看是否正确
如果方便的话 也麻烦大家提醒我 我的理解还有哪些不足
感谢大家!
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 36.232.184.189
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/Python/M.1455530682.A.8FE.html
※ 编辑: peace9527 (36.232.184.189), 02/15/2016 18:05:29
1F:推 Thisisnotptt: bs只是用来处理你抓下来的网页文字档,所以seleniu 02/15 19:25
2F:→ Thisisnotptt: m跟bs应该是不冲突的 02/15 19:25
3F:→ MOONY135: 不冲突 要做动作的话request好像也可以 02/15 21:59
4F:推 xlk: 一般用selenium+css/xpath selector抓element text, 除非需要 02/16 00:57
5F:→ xlk: 复杂互动再考虑混用。高效应该还是BS only抓已知网址内容。 02/16 00:57
6F:→ xlk: request data/url/selector当然就靠browser developer tool功 02/16 01:02
7F:→ xlk: 能找出来 02/16 01:02
8F:→ blc: 叫做 Headless browser 的样子。 02/16 14:08
9F:→ blc: 我错了,selenium跟headless browser差颇多。 02/25 13:47
10F:→ xlk: selenium可以用phantomjs的ghostdriver是headless的… 03/05 22:32
11F:→ xlk: 前面说的不太对.selenium适合需要复杂互动时用 一般BS就够 03/05 22:37