作者okeyla (小宝)
看板Python
标题Re: [问题] python网路爬虫,怎麽抓取表格内容
时间Sat Jul 22 10:32:46 2017
※ 引述《okeyla (小宝)》之铭言:
: 我想一次抓取全家便利店全省的商店资讯,
: 观察到是他以每个县市命名为各自的.php, 然後各县市商店都在对应的php里面.
: idea是先抓取各县市的php名称放入list,
: 再以此list带出各县市的网页, 再取出商店资讯.
: 目前卡在这儿, 找不着标签...
: import requests
: from bs4 import BeautifulSoup
: res = requests.get('http://www.allergen.com.tw/famistore.php')
: res.encoding = 'utf-8'
: #print res.text
: soup = BeautifulSoup(res.text)
: # 跑个loop挑出famiKeelung.php, famiTaipei.php... etc.
: print soup.select('.td') <--- 啊?!
: 可以指导一下吗???
知道一个页面当中有两个table, 一个是广告, 另一个是要的资料.
但没有class,没有id可供soup select...
是不是有妙法把<a href>的内容(i.e., 那些php)取出呢?
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 118.160.83.246
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/Python/M.1500690769.A.A6B.html
1F:推 LessonWang: css selector 不是只有class和id选择器而已啊xd 07/22 11:00
2F:→ LessonWang: 话说原po怎不想使用lxml的etree以及HTMLParser 07/22 11:00
3F:→ LessonWang: 搭配浏览器的xpath checker 07/22 11:00
4F:→ LessonWang: 很快就抓的到资料啦xd 07/22 11:00
6F:推 LessonWang: 这些href属性值应该是你要的部分吧 07/22 11:03