作者sky800507 (B翰)
看板Python
标题Re: [问题] 爬虫新手请益
时间Mon Jan 16 23:36:50 2017
※ 引述《ntumath (math mad)》之铭言:
: 大家好,小弟我打算在这个寒假要学爬虫
: 网路上我自己可以查到有BeautifulSoup,Scrapy,Selenium这三种
: 想请问这三种爬虫有难易之分吗,还是就先选定一种顺顺的学下去就好?
刚好有人问到,小弟又会一点点爬虫,所以帮忙回答一下!
1. requests -> 撷取资讯。 将网页上的资讯撷取下来,一般常用get还有post的方法
2. selenium -> 撷取资讯。 遇上一些比较难搞的动态网页,
如Facebook的社团是没办法用API来取得资讯,
这时候就会用selenium操纵真实的浏览器来撷取资讯
3. BeautifulSoup -> parser剖析器。 将抓取回来的网页资讯用DOM的方式剖析,
更容易取得网页标签里的内容
4. Scrapy -> 爬虫框架。 可以更有效率的去管理与执行爬虫专案
所以一般需求的网路爬虫直接使用requests与selenium获取资料,
BeautifulSoup剖析资料就能够满足需求
比较具规模的爬虫专案可能就会使用scrapy框架
(一样会用到requests, selenium, BeautifulSoup)
学习的顺序应该是1、3先,再来2,最後再4
如说明有误或不齐全,欢迎补充或指正!!
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 118.160.152.16
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/Python/M.1484581012.A.236.html
1F:推 max80713: 感谢sky大解说~ 01/17 02:08
2F:推 jia1013: 感谢sky大 01/17 03:29
3F:推 exthrash: 推! 01/17 05:26
4F:→ sky800507: 补充一下,正规表达在爬虫也很常用到 01/17 12:46
5F:→ king4647: 也可以学xpath 不错用 01/19 11:03
6F:推 sky094315: 推。想请问一下大大,想熟练使用requests的用法要搜寻 01/27 14:19
7F:→ sky094315: 哪些关键字?因为我在网路上找到的几乎都是使用Beautif 01/27 14:19
8F:→ sky094315: ulSoup,谢谢 01/27 14:19