作者jackhzt (巴克球)
看板Python
标题[问题] 不知道是哪边出了问题 求救
时间Sun Feb 14 16:40:27 2016
刚学python不到1个月
尝试用python抓点资料
print爬取出来都很正常
但是要储存资料时却出现了
UnicodeEncodeError: 'cp950' codec can't encode character '\u5367' in position
2763: illegal multibyte sequence
请问一下这是哪边出了问题?
有解决的方法吗?
以下是程式码:
import requests
from bs4 import BeautifulSoup
import lxml
u="
https://zh.wikisource.org/wiki/%E9%87%91%E7%93%B6%E6%A2%85/%E7%AC%AC01%E5%9B%9E"
res2=requests.get(u)
soup=BeautifulSoup(res2.text,"lxml")
data=soup.select("
#mw-content-text")[0].text
titles=(soup.select("td ")[2].text[4:-8].strip())
loca="D:\\bigdata\\testR\\word\\金瓶梅\\"+titles+".txt"
with open(loca,"w") as my_file:
my_file.write(data)
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 223.26.81.29
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/Python/M.1455439229.A.059.html
1F:→ alibuda174: 你的open开档预设为cp950编码,无法储存某些字元 02/14 16:43
2F:→ alibuda174: from io import open 02/14 16:48
3F:→ alibuda174: open(loca, 'w', encoding='utf8') 02/14 16:49
4F:→ jackhzt: 成功了 谢谢大大 02/14 16:52
5F:→ jackhzt: io这东西好猛 等等看一下他在看嘛 竟然这样就可以跑了~ 02/14 16:53