作者PsMonkey (痞子军团团长)
看板java
标题Re: [问题] html parser功能一问
时间Fri Aug 28 15:50:13 2009
※ 引述《conan99 (Edison)》之铭言:
: 想请教JAVA前辈
: 最近我要写一个程式上网抓网页的特定部份的资料
: 比如标签:
: <div id="contentBlock">
: <div id="articleBlock">
: 内的连结或显示文字
: HTML PARSER能帮我方便地找到该特定资料吗?
: 还有,HTML档需要先抓下来吗?
: 还是可以线上读取,只抓特定资料
: 谢谢
: ==================================================
: 囧了,我没有犯规的意思~~请饶命
: 只是都还不解,想请人解惑^^
: 充实内容....还在摸索中不知道怎麽充实..
: 提供一下HTML Parser的连结
: 网站:http://htmlparser.sourceforge.net/
: 版本:2.0
如果你要问可不可以,有规律的网页,是一定可以处理的
(没规律的... 就先不用考虑了.....)
所以,就你的问题,回答一句「可以」就结案了
这样的讨论没啥意义,我想你也获得不了什麽东西
请你充实内容,这个「充实内容」是在一个基础上
就是你已经开始用 HtmlParser 去处理你要的 html
然後问你无法做到 or 不知道如何做到的功能
(当然,class 不会用,这勉强也可以问,但是要作更多功课)
你的文章看下来,就我的感觉
你可能连 HtmlParser 是圆是扁都还不知道
不知道不是罪,只是这样子就上来问,不太负责任也不会有啥好结果
所以才有那个「警告」
以上
====
最後,有没有抓 HTML 存成档案,不影响 fetch 资料
只是我的实做经验来讲,存成档案,重复使用起来会比较快乐
--
侃侃长论鲜窒碍 首页:
http://www.psmonkey.idv.tw
众目睽睽无心颤 Blog:
http://ps-think.blogspot.com
茕居少聊常人事
杀头容易告白难 欢迎参观 Java 版(@ptt.cc) \囧/
--
※ 发信站: 批踢踢实业坊(ptt.cc)
◆ From: 58.114.208.48