作者tosakashiron (翰)
看板Python
标题[问题] 爬虫出网站中所有的内文
时间Fri Sep 1 22:42:37 2017
大家好
小弟目前爬虫初学者
在目前的专案中需要用到爬虫
但是是不知道会去爬哪个网站
应该说目标是丢入任意网址都要可以丢出该网站的内文
有点像是google搜寻引擎中
搜寻完的网站下方会出现预览内文一样
不知道有没有办法可以做到
或是github上面有神人已经写出相关的API可以使用
因为不知道用什麽关键字搜寻比较好
所以找到的大部分都是只能爬出特定网站
或是只能爬出网址中的网址
跟我所想要的不太一样
拜托各位神人大大了
谢谢!!!
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 119.77.130.74
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/Python/M.1504276959.A.C92.html
1F:嘘 ptt0720: beautifulsoup 你有点懒惰哦 09/01 23:18
2F:→ vi000246: 首先你要定义内文 09/02 00:11
3F:嘘 karta0910489: 请定义内文 09/02 03:20
4F:→ tosakashiron: 谢谢楼上大大们的回应 09/02 14:11
5F:→ tosakashiron: 我想要的内文就是网站的所有文字内容 09/02 14:11
6F:→ tosakashiron: 只有会给使用者看得到的内容 09/02 14:11
7F:→ tosakashiron: 小弟我会使用beautifulsoup 09/02 14:11
8F:→ tosakashiron: 但是一定要定义tag才能find并解析 09/02 14:11
9F:→ tosakashiron: 有没有办法是不需要定义tag就可以爬出来 09/02 14:11
10F:→ tosakashiron: 因为每一个网址的tag都不一样 09/02 14:11
11F:→ tosakashiron: 不知道有没有办法 09/02 14:11
12F:→ tosakashiron: 先在此谢谢大家!! 09/02 14:11
13F:→ blc: urllib.open(url).read() 09/02 15:47
14F:嘘 coeric: 网页页面是人写的,没人规定tag要怎麽用 页面要怎麽排 09/03 11:28
15F:→ coeric: 简单一句话:case by case 09/03 11:29
16F:→ zerof: search engine crawler 09/03 14:33
17F:嘘 yulin0619: 上网查都是英文的,看不懂可以买中文书啊,又不是说没 09/04 23:38
18F:→ yulin0619: 书可买 09/04 23:38