作者busystudent (busystudent)
看板Python
标题[问题] 询问关於解析网页的观念–如何去html码
时间Mon Apr 4 13:25:49 2016
最近几日在做爬虫网页,步骤如下:
Step1输入网址
Step2撷取网页
Step3去html码(text cleaning)
我的目标是取得网页内文,後分析,例如,切出网页内文前十常出现的字词。
唯独去html码(text cleaning)一直让我头痛,我使用正规化去销html码,如下所示
import re
TAG_RE = re.compile(r'<[^>]+>')
def remove_tags(text):
return TAG_RE.sub('', text)
如果只有一两个网页,效果不错,因为我可以手动检查网页是否有内文,而不是入口网站
ya
我想请问几个观念
1. 使用正规化去除html码是足够有效的吗?
2. 当一次面对上百笔网页时,是前期step1时就要先(手动或自动)分析好网页,去
除?
3. 还是想打听,大家都是怎麽处理这方面的问题
--
Sent from my Windows
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 223.140.224.116
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/Python/M.1459747552.A.3BB.html
1F:→ yeh6: BeautifulSoup?04/04 13:54
2F:→ yeh6: BeautifulSoup?04/04 13:54
感谢提供,之前推文是我功课不足,还请见谅
3F:→ uranusjr: 如果不想另外装东西, 你需求内建的 html parser 就够了04/04 14:07
※ 编辑: busystudent (223.140.224.116), 04/04/2016 14:47:23 感谢提醒,我马上去
找相关资料,谢谢
※ 编辑: busystudent (223.140.224.116), 04/04/2016 14:48:32
4F:推 htc812: 不太懂你意思耶,但我用bs4.getText方法来去除tag觉得还蛮04/05 00:32
5F:→ htc812: 好用的呀04/05 00:32
马上找相关资料,感谢
※ 编辑: busystudent (223.140.224.116), 04/05/2016 10:32:21
6F:推 PRAM: 所以你还不知道怎麽用beautifulsoup就回推文了吗?04/05 16:32
Sorry BeautifulSoup 我还以为只有指定位置抓内文的功能,去查才知道自己功课做不足,观点不对
※ 编辑: busystudent (223.140.224.116), 04/05/2016 17:09:53
※ 编辑: busystudent (223.140.224.116), 04/05/2016 17:11:55
※ 编辑: busystudent (223.140.224.116), 04/05/2016 17:24:31
7F:→ gozule: lxml也很好用,可以试试 04/05 18:03
8F:推 aweimeow: 推 lxml 我也习惯用 lxml 来做 04/05 23:43
9F:→ s860134: 我也喜欢用 lxml 04/07 01:18
10F:推 paoju5566: 自从用了lxml考试都考100分 04/09 02:40