作者idleryan (QQ)
看板Python
标题[问题]初学者爬虫截取超连结问题
时间Mon Jul 17 16:22:07 2017
板上各位强者好
最近因为故宫开放所有收藏品的图片下载
因此拿来当作第一次自学python程式写一个简易的爬虫
目前想到比较不自动的方式 -
从第一页爬到最後一页或取所有下载的连结
再用其他下载软体慢慢下载,但使用回圈时,一直连不去下一页
新手程式码如下,还请大家指点迷津
import requests
from bs4 import BeautifulSoup
for _page in range(1,2,1):
res = requests.get("
http://theme.npm.edu.tw/opendata/DigitImageSets.aspx?pageNo=%d"
% _page)
soup = BeautifulSoup(res.text, 'lxml')
a_target = soup.find_all('a','fancybo_xxxx fancybox.iframe')
for a in a_target:
print(a['href'],a.text)
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 61.222.221.39
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/Python/M.1500279733.A.C6C.html
※ 编辑: idleryan (61.222.221.39), 07/17/2017 16:22:55
1F:推 Yshuan: range(1,2,1) 只有 list: [1] ... 07/17 16:40
2F:→ idleryan: range(1,2,1)不是指start at 1, end at 2, step = 1还是 07/17 16:43
3F:→ idleryan: 我打错了?? 07/17 16:44
4F:→ Nieto: range(1,3,1)才是从1开始, 到2结束 07/17 16:49
5F:→ idleryan: 我了解了...2结束,所以不会进loop .... 07/17 16:49
6F:→ coeric: 用while 然後照staus去决定回圈的跳出即可 不必管几页 07/18 01:29