作者IsMe1086 (大头)
看板Python
标题[问题] 中文编码
时间Sat Dec 19 09:44:46 2015
小弟是刚接触PYTHON的新手 正在练习抓网页的写法
已经爬版和GOOGLE 还是找不到方法
先附上程式码
import urllib
import urllib.request
thisurl = "
http://www.cna.com.tw/"
handle = urllib.request.urlopen(thisurl)
html_gunk = handle.read().decode(encoding="utf-8",errors="ignore")
f = open('t.txt','w')
f.write(html_gunk)
然後出现错误讯息
Traceback (most recent call last):
File "openurl - wf.py", line 15, in <module>
f.write(html_gunk)
UnicodeEncodeError: 'cp950' codec can't encode character '\xf1' in position
15378: illegal multibyte sequence
麻烦高手指点迷津
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 211.72.212.247
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/Python/M.1450489489.A.B2A.html
1F:→ alibuda174: open时也指定编码utf-8试试 12/19 09:53
2F:→ IsMe1086: 可以了!感谢你~~~ 12/19 10:22