作者mahoihei (Alvar)
看板java
标题[问题] HTML PARSER出包了,还是我使用方法错了?
时间Sat Jun 11 21:28:16 2011
先给上我要解析的网站
http://goo.gl/FXmDR
用的是html parser 1.6版本
我的想法是用TagNameFilter,过滤出<ul>TAG的nodelist
,再找出nodelist的第一个NODE <ul class="archiver_forumlist">
就可以提出整个列表了
可是出来的结果是, 确实抓出<ul class="archiver_forumlist"> </ul>
的内容,可是我抓出来的列表到
<li><a href="archiver/?fid-206.html">吹水广场</a></li>
</ul></li>
</ul></li>
就停了, 我看看抓出来的HTML码比对网站的发现
<li><a href="archiver/?fid-206.html">吹水广场</a></li>
</ul></li>
</ul></li></ul> <<多了个</ul>
nodelist的第一个node变成了
<ul class="archiver_forumlist">
..略N字
<li><a href="archiver/?fid-206.html">吹水广场</a></li>
</ul></li>
</ul></li></ul>
若是没解的话,有另外一些解析HTML的API吗
--
※ 发信站: 批踢踢实业坊(ptt.cc)
◆ From: 116.49.240.161
1F:→ mahoihei:顺便问一下,XML的PARSER可以用来读HTML吗 06/11 21:29
2F:→ nanashi07:解析HTML请先处理容错问题,不是每个网站的html source都 06/11 22:43
3F:→ nanashi07:是符合结构的,可以参考htmlcleaner 06/11 22:44
4F:→ mahoihei:"合符结构"是什麽意思??? 06/11 23:22