作者TZULIU (消费券收购商)
看板Python
标题[问题] Scrapy无法抓取资料
时间Mon Jul 10 13:48:04 2017
小弟最近在练习使用Scrapy,在网路上找了一个练习范本如下:
https://www.youtube.com/watch?v=w4PPlkJFzCo
前半段运作没有任何问题,
但当开始使用 yield scrapy.Request 的时候却发现spider没有爬取到资料,
想请问各位高手原因为何?
程式码如下:
import scrapy
from bs4 import BeautifulSoup
class Apple1Spider(scrapy.Spider):
name = 'apple'
allowed_domains = ['appledaily.com']
start_urls = ['
http://www.appledaily.com.tw/realtimenews/section/new/']
def parse(self, response):
domain = "
http://www.appledaily.com.tw"
res = BeautifulSoup(response.body)
for news in res.select('.rtddt'):
yield scrapy.Request(domain + news.select('a')[0]['href'],
callback=self.parse_detail)
def parse_detail(self, response):
res = BeautifulSoup(response.body)
print(res.select('#h1')[0].text)
我所使用的版本为Python3.6.1,
谢谢。
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 114.40.106.213
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/Python/M.1499665687.A.E59.html
※ 编辑: TZULIU (114.40.106.213), 07/10/2017 14:00:58
1F:→ coeric: scrapy不给装 用requests捞 没啥问题 07/10 18:01