作者processior (korman)
看板Python
标题[问题]Content-Encoding:gzip 爬虫如何解压缩
时间Fri Oct 14 23:47:33 2016
最近在写一只爬虫程式
遇到有些网站是采用gzip压缩後再传送资料
如果用python3 开启
cj = Http_Cok.CookieJar()
opener = urllib.request.build_opener(urllib.request.HTTPCookieProcessor(cj))
res = urllib.request.Request(html,headers = Header_data())
data = opener.open(res).read()
print(data)
都是十六进制的编码,到网路上google 好像是要先解压缩
否则beautifulsoup也无法解读,毕竟不是utf-8 格式
网路上的解法试了也没用大部分都是介绍pyton2的解法
不知道有人知道python3要如何解吗??
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 101.9.179.118
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/Python/M.1476460056.A.DFE.html
1F:推 kenduest: 用 requests 比较省事 10/15 02:35
2F:推 laputaflutin: requests+1, 看这种等级的python api doc根本享受 10/15 08:08
3F:推 eight0: data = gzip.decompress(data) 10/15 12:29
4F:→ eight0: 用 requests 比较方便+1 10/15 12:29
5F:→ kenduest: 发问者之前那篇就有人给他建议了,看起来应该是没换 10/15 16:16
6F:→ kenduest: 以前个人用 python 一开始还不知道 requests 也是 10/15 16:17
7F:→ kenduest: 用 urllib, 真是搞死人,python 2,3 还稍微得改程式码 10/15 16:17
8F:→ kenduest: 用 requests 之後就一切轻松,且要 keep-alive 也简单 10/15 16:17