作者ajsaak (光)
看板Python
标题[问题] 网页资料撷取问题
时间Thu Dec 24 20:16:07 2015
有几个问题想问问,本身没程式基础,参考一些文章使用下面的指令
import urllib2
from bs4 import BeautifulSoup
url = '
http://zh.divine-gate.wikia.com/wiki/1509'
request = urllib2.Request(url)
request.add_header('Accept-Encoding', 'utf-8')
response = urllib2.urlopen(request)
soup = BeautifulSoup(response)
print soup.text
问题1.最後显示出来,仍然有许多不需要的部分,用Infolite取得表格文字在
td跟th部分尝试改成print soup.select('td'),但却变成似乎有乱码的情况
问题2.现在是使用notebooks操作,如果要输入成挡案成纯文本该如何作?改成py档
执行完就直接不见了
问题3.如果要大量撷取,要如何修改呢?
如:
http://zh.divine-gate.wikia.com/wiki/xxxx XXXX=1~1500
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 36.237.87.78
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/Python/M.1450959371.A.535.html
1F:推 alair99: 用回圈来变更url参数 12/24 23:41
3F:→ alair99: 很实用 12/24 23:44
4F:→ ajsaak: 这网站我有看,也是跟着学BS4筛选 但不筛选不会有乱码 12/25 13:07
5F:→ ajsaak: 加上筛选条件 却有乱码 但输入已加上UTF8了? 12/25 13:07
7F:推 alair99: 你说的乱码是td标签那些吗 XD 12/25 15:33
8F:→ ajsaak: 不是喔 是如果筛选Td下的部分 会变成\u6c42\u3081\u308b\ 12/25 19:24
9F:→ ajsaak: 这样 12/25 19:25
10F:→ s860134: 从他 print 的方式就知道是2.X 了 又是unicode的问题 12/25 20:31
11F:→ s860134: 你可以尝试 a = u"\u6c42\u3081\u308b";print(a) 12/25 20:32
12F:→ ajsaak: 这样还是不行 试了几个方法後 改用3.5就OK了 12/26 13:10