作者kobe52072200 (吴小帅)
看板Python
标题[问题] python 爬取pchome资料
时间Mon Apr 11 11:42:43 2016
大家好 小弟最近刚开始学网路爬虫 刚好看到有老师在网路上教学 教学连结如下
http://www.largitdata.com/course/9/
由於范例影片是用淘宝举例 我就想说那改来爬Pchome 最近刚好想买电动刮胡刀
於是在Pchome首页搜寻电动刮胡刀 跑出项目後写以下的程式
import requests
import bs4 from BeautifulSoup as bs
res =
requests.get('
http://ecshweb.pchome.com.tw/search/v3.3/?q=%E9%9B%BB%E5%8B%95%E5%88%AE%E9%AC%8D%E5%88%80')
soup = bs(res.text, "html.parser")
print soup
想说先看一下soup列印出来後有没有包含网业上的品项资讯 但却没有
之後的步骤也不知道怎麽进行下去了
上述的网址是在搜寻页面按右键→检查→Network→类型选择Doc 得到的url
不知道有没有版友爬过Pchome 可以教教小弟吗 谢谢大家~~
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 60.248.2.226
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/Python/M.1460346166.A.9D2.html
1F:推 Yshuan: 我看是在<dd id="ItemContainer">里面 捞不到吗? 04/11 13:34
2F:推 Thisisnotptt: 刚刚试了一下,应该是JS的问题,所以我改用selenium 04/11 13:38
4F:→ Thisisnotptt: pip 可以直接装,然後抓这个放入在同目录: 04/11 13:41
6F:→ kobe52072200: 谢谢T大回答 我现在出现错误讯息 04/11 16:41
7F:→ kobe52072200: 'phantomjs' executable needs to be in PATH 04/11 16:41
8F:→ kobe52072200: 我不知道要把载下来的selenium丢到哪里 ~ 04/11 16:42
9F:→ kobe52072200: 再麻烦T大了 谢谢 ~ 04/11 16:42
10F:→ kobe52072200: 说错是phantomjs~ 04/11 17:48
11F:推 Thisisnotptt: 耶? 解压缩之後会是一个资料夹对吧? 里面有bin资料 04/11 20:51
12F:→ Thisisnotptt: 夹,里面有phantomjs。 把路径改成他就可以了,或是 04/11 20:51
13F:→ Thisisnotptt: 把这个phantomjs抓出来放在同木录下他就会找得到了 04/11 20:52
14F:→ Thisisnotptt: 应该有这个就搞得定了。 04/11 20:53