作者areyo (没有名字的怪物)
看板Python
标题[问题] WSJ网站上的资料抓取
时间Fri Nov 25 16:00:58 2016
各位午安
想请教如何抓取wsj.com上面某档股票的历史资料
例如Nikkei 225
http://quotes.wsj.com/index/JP/XTKS/NIK/advanced-chart
目前仅会'手抓',利用Chrome + F12去抓取JSON数据
https://dl.dropboxusercontent.com/u/14347169/wsj.png
想请教版上高手,这要怎麽抓取呢??
谢谢
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 1.174.246.28
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/Python/M.1480060861.A.917.html
1F:→ gozule: 用scrapy抓完後再parse 11/25 21:33
2F:→ areyo: scrapy该如何抓?? 谢谢 11/26 08:12
3F:→ areyo: 如果用urllib, request能否抓取呢?? 11/26 09:23
4F:→ Neisseria: 用 urllib 要自行处理细节,用 scrapy 就省下这些工夫 11/26 09:35
5F:→ Neisseria: 如果不会用 scrapy,可以用 requests 函式库 11/26 09:35
6F:→ Neisseria: 这些函式库/框架都有网站,可以上去看一下相关说明 11/26 09:40
7F:→ s860134: 老实说你的问题应该是怎麽爬那个网站吧 11/26 16:51
8F:→ areyo: 是想爬该网站某档股票的历史股价 11/26 16:54
9F:→ s860134: header 抄一抄,解析一下那些 url parameter的规律 11/26 16:55
10F:→ s860134: 像是你要爬多档股票你要知道股票清单在哪或是名称规律 11/26 16:55