作者imimi (im)
看板Python
标题[问题] 求救 ...困在编码问题
时间Tue Aug 30 22:03:44 2016
想请教各位高手
我有个input.txt 我很确定他是用utf-8储存的
但是用以下的beautiful soup 处理 strip tag
却还是乱码 想请问是不是哪里写错了 谢谢
import requests
from bs4 import BeautifulSoup
res = requests.get('
http://localhost/input.txt',verify=False)
obj=bytes(res.text, "utf-8")
UTF8str=obj.decode('utf-8', 'ignore')
soup = BeautifulSoup(UTF8str, "html.parser")
text = soup.getText()
print(text)
但是出来 还是乱码
我是照着书打的 实在不知道问题出在哪
感谢各位高手 ....orz
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 180.217.14.99
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/Python/M.1472565827.A.D8A.html
1F:推 Neverfor: 讨厌win10记事本 08/30 22:19
※ 编辑: imimi (180.217.14.99), 08/30/2016 22:26:02
2F:推 enjoyloli: #-*- coding: utf-8 -*- 有用吗? 08/31 00:07
3F:→ uranusjr: 既然文字内容就是 UTF-8, 你为什麽要 encode 又 decode 08/31 05:50
4F:→ uranusjr: 直接把 res.text 拿去 parse 不就好了? 08/31 05:50
5F:→ imimi: 感谢感谢~~ 理解了~~~ 03/10 17:39