作者aitbtitw (你好)
看板Python
标题[问题] 如何移除tag保留里面内容呢?
时间Tue May 10 18:49:35 2016
小弟是python新手 最近刚开始学习爬虫
但是最近遇到一个问题 就是怎麽都移除不了<li>
以下部分是程式码
import urllib.request
import re
from bs4 import BeautifulSoup as bs4
page = urllib.request.urlopen('
http://health.udn.com/disease/sole/185');
html = str(page.read(),'utf-8')
soup = bs4(html, 'html.parser')
s = soup.select('.outbreak > ul')
s = s[0]
print(s)
输出结果为:
<ul><li>随年龄增长而提高。男性大於45岁,女性大於55岁,又男性发生率高於女性。
</li><li>患有高血压、糖尿病、高血脂等疾病者。尤其糖尿病患常合并有三高,加上多
重代谢异常,坏胆固醇容易囤积在血管内,造成大规模阻塞病变。</li><li>情绪容易紧
张、易怒、忧虑和恐慌者。</li><li>过度劳累、生活压力大者。</li><li>缺乏规律运动
习惯者。</li><li>胆固醇、血脂肪及三酸甘油脂数值过高者。</li><li>菸瘾者,因抽烟
会加速粥状动脉硬化。</li><li>冠状动脉心脏病患者,或有冠状动脉心脏病家族史者。
患者因动脉硬化血管腔狭窄,很容易造成阻塞。</li></ul>
烦请各位高手指点了 谢谢大家
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 180.176.90.103
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/Python/M.1462877377.A.7DC.html
1F:→ obelisk0114: 请看 beautifulsoup 的官方文件,里面有写 05/10 19:49
2F:推 octantis: 看你是要全部抓一起还是一个个抓,全部抓一起用s.text 05/10 21:30
3F:→ octantis: 分开抓用s.strings或s.elements.text 05/10 21:35
4F:→ woogee: print s.text 05/11 04:55
5F:→ ripple0129: 你乾脆用regex自己把tag移除掉 05/12 01:41
6F:→ aitbtitw: 谢谢各位。已经解决了 05/12 15:44