作者cawaiilulu (across)
看板Python
标题[问题] 用beautifulsoup抓网页中的表格
时间Fri Aug 4 03:50:07 2017
要抓一个wiki page中的表格以计算
但是我只会作到抓下整个html码
接下来就不知道怎麽作
https://en.wikipedia.org/wiki/World_Series_television_ratings
像以上这样
请问我要怎麽样才能够只抓下 1984~年的收视率表格?
Television ratings by year, 1984 – present
python3 谢谢
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 69.117.241.97
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/Python/M.1501789810.A.4EF.html
1F:推 ntumath: bf = Beautiful(url,'html.parser') 08/04 08:30
2F:→ ntumath: target = bf.findAll('table')[1] 08/04 08:30
3F:→ ntumath: 想做计算可以用pandas,先熟悉用bf抓contents吧 08/04 08:33
我有作到这一步 但是那个页面有很多表格 我不太确定要怎麽限定在我要的那一个表格
然後抓下来进行计算
是否应该开网页html码 然後用 ("div", {class}:..........)
後半部不知应该怎麽看
4F:→ coeric: 楼上的汤被偷了........ 08/04 11:14
5F:→ coeric: pandas很强,但也很鸡肋 遇到一些很乱的网页时 08/04 12:07
6F:→ coeric: 所要的资讯尽乱塞在表格很奇怪的地方 而且还是分开的 08/04 12:07
7F:→ coeric: 我就放弃pandas,改回归原始的美丽的汤 08/04 12:08
8F:→ coeric: 不过,用美丽的汤,也是得突破千万难关 才有办法抵达 08/04 12:09
9F:→ coeric: 就是同你说的 ("div", {class}:... 08/04 12:09
10F:→ coeric: 昨天在捞统联客运的讯息时,差点没吐血........ 08/04 12:10
所以该怎麽作呢? 用beautifulsoup的documment要怎麽找关键字来查出
我想要的产出的作法? 谢谢!
※ 编辑: cawaiilulu (69.117.241.97), 08/04/2017 12:33:28
11F:→ coeric: 就你说的 一样是看html找标签 08/04 13:07
12F:→ coeric: 按F12 进到开发人员模式去看 08/04 13:11
13F:→ ntumath: 要是只抓这种一页的资讯,怕麻烦就用xpath或css一键复制 08/04 21:24
14F:→ ntumath: 会用到特别标注id,class这种的 通常是需要抓同个架构下 08/04 21:25
15F:→ ntumath: 差不多的内容,但是怕重新request的时候改变xpath的那种 08/04 21:27