作者zilong308 (派大星)
看板Python
标题[问题] 网页抓资料特殊符号处理
时间Tue Jan 27 09:44:25 2015
大家好
小弟最近使用python抓取网页资料
在网页原始档中有td标签如下的
<td align="right" width="56">
755
</td>
都能顺利读取其值 755
使用方法是SGMLParser
但现在有个问题
<td align="middle" class="12red" width="61">
<font color="red">
▲+8
</font>
这种的td标签虽然有3个attrs,若没有下面的font标签,我想也不难抓取值
但现在不只有font标签,而且"▲"这个要怎处理?
小弟现在以parse标签带三个属性的方式硬处理,结果未能抓取其值(或抓取到空白?)
因为print出来似乎是一个空格而已
希望板上大大能帮忙解惑,感恩~
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 140.96.28.93
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/Python/M.1422323070.A.CE6.html
※ 编辑: zilong308 (140.96.28.93), 01/27/2015 09:45:04