作者blc (Anemos)
看板Python
标题Re: [问题] unicode里有str资料该怎麽转?
时间Wed Feb 3 17:10:18 2016
※ 引述《blc (Anemos)》之铭言:
: 请问一下,最近在试fbchat时,有个unicode变数一直print出乱码,
: 用repr印出来长这样:
: u'\xe7\x9c\x8b\xe6\x9c\x89\xe6\xb2\x92\xe6\x9c\x89\xe8\xa3\x9dlzma'
: 看起来像是把str的内容塞进unicode了(明明只有json.loads()),
: 请问该怎麽把它的内容转成正常的unicode印出来呢?
我又来了……
这次的unicode变数长这样:
u'\u0107\x98\u017b\u013a\x95\x8a'
内容是utf-8的'是啊',但看起来就是某几个unicode字元变成utf-8字串了。
直接给 .encode('iso-8859-1','ignore') 的话\u部份的就被省掉了……
如果是纯字串的'是啊'会是下面的样子:
'\xe6\x98\xaf\xe5\x95\x8a'
纯unicode的话是:
u'\u662f\u554a'
请问这要怎麽解?
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 140.109.254.74
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/Python/M.1454490621.A.A38.html
1F:→ blc: json.loads()问题实在有点多…… 02/03 17:13
2F:→ alibuda174: c = u'\u0107\x98\u017b\u013a\x95\x8a' 02/03 17:46
3F:→ alibuda174: print(c.encode('iso-8859-2').decode('utf-8')) 02/03 17:46
4F:→ blc: 哦哦感谢,我真该好好k手册了 02/03 20:17
5F:→ blc: 有找到 chardet module,但是只能侦测str的样子…… 02/04 11:05
6F:→ blc: 然後侦测起来好像也不太准…… 02/04 11:06