作者unhumanWu (阿文)
看板Python
标题[问题] 爬虫资料格式及处理
时间Wed Oct 25 22:12:28 2017
大家好,初学爬虫
透过以下程式抓到文字资料
https://imgur.com/mGAOY9I
https://imgur.com/GwWX8f3
想问一下这是哪种资料类型阿?
有像html之於BeautifulSoup的library可以处理吗?
感恩!
import requests
user_agent = 'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_10_5)'
headers = {'User-Agent': user_agent,
'Referer':'
http://www.family.com.tw/marketing/inquiry.aspx'}
response = requests.get("
http://api.map.com.tw/net/familyS"
"hop.aspx?searchType=ShopList&type="
"&city=%E5%9F%BA%E9%9A%86%E5%B8%82"
"&area=%E4%BB%81%E6%84%9B%E5%8D%80&"
"road=&fun=showStoreList&key=6F30E8"
"BF706D653965BDE302661D1241F8BE9EBC"
, headers=headers)
response.text
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 220.136.49.4
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/Python/M.1508940751.A.DCD.html
1F:→ stucode: 看起来是 JSON,Python 有内建函数库。 10/25 22:23
2F:推 ssdoz2sk: 你把前面的 showStoreList( 去掉,还有最後的 ) 去掉, 10/25 22:23
3F:→ ssdoz2sk: 就可以用 json.loads 读取 JSON 10/25 22:25
4F:推 ckc1ark: JSONP 用来绕过same origin policy的 10/25 22:27
5F:→ vi000246: 你网址里面有一串key参数 这应该是csrf token吧 10/26 00:39
6F:→ vi000246: get的时候要记得更新这个key 10/26 00:40
7F:→ vi000246: 还有个fun参数 应该是用来决定回传的资料格式 10/26 00:41
8F:→ vi000246: 你可以研究一下怎麽让他直接传回json 10/26 00:41
9F:推 rexyeah: eval(response.text.strip()) probably get a dict 10/26 08:41
10F:→ rexyeah: 楼上说的没错 要把showStoreList去掉才eval得出东西 10/26 08:49
11F:推 TitanEric: JSON 10/26 15:13
把showStoreList去掉就可顺利读取,感恩!
fun的部分有storeTownList和showStoreList
一个列出有店点的行政区;一个是店点资料
key的部分目前看似乎都长一样
https://imgur.com/DVCqwNu
https://imgur.com/3Tar5R8
※ 编辑: unhumanWu (220.136.49.4), 10/26/2017 20:43:07