作者Czero (悠闲)
看板Python
标题[问题] 请问撷取原始码中文问题
时间Fri Jul 3 23:25:54 2015
撷取的页面:
http://isin.twse.com.tw/isin/C_public.jsp?strMode=2
我是用python3 , sublime执行
但印出的中文会显示如\xa1@\xa5x\xaad这样字眼
使用python console >>> b'\xa1@\xa5x\xaad'.decode('utf-8')解不出来
请教各位这该如何解,编码实在很恼人...
---
# -*- coding:utf8 -*-
import urllib.request as urllib2
import sys
headers = {'User-Agent':'Mozilla/5.0 (Windows; U; Windows NT 6.1; en-US; rv:1.9.1.6) Gecko/20091201 Firefox/3.5.6'}
req = urllib2.Request('
http://isin.twse.com.tw/isin/C_public.jsp?strMode=2' , headers=headers)
content = urllib2.urlopen(req).read()
print(content)
---
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 61.231.192.105
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/Python/M.1435937158.A.4A3.html
1F:→ yan12125: 这个网页是Big5 07/03 23:48
2F:推 Thisisnotptt: 我很懒,我都用django的smart_string来处理这种事, 07/04 00:10
3F:→ Thisisnotptt: 编码什麽的几乎都能搞定,超方便的啦 07/04 00:10
4F:→ Czero: @@原来是big5..哈!因为初学所以先玩一下再去用Django 07/04 00:22
5F:→ uranusjr: 请爱用 chardet 07/04 00:31
6F:→ Czero: 感谢各位! 07/04 00:35
7F:→ Czero: 另外请问...在console打>>>b'\xa5x\xaad'.decode('big5') 07/04 00:36
8F:→ Czero: 但在程式打print(b'\xa5x\xaad'.decode('big5'))似乎不行? 07/04 00:37
9F:→ uranusjr: Windows 请再加一段 .encode('cp950') 07/04 01:38
10F:→ Czero: 我是希望sublime可以也印出中文'台泥'的字眼 07/04 01:49
11F:→ uranusjr: 不要用 Sublime Text console 谢谢 07/04 16:27