作者qrtt1 (null)
看板java
标题Re: [问题] 如何抓取网页上的文字
时间Mon Feb 16 13:31:22 2009
※ 引述《tkcn (小安)》之铭言:
: ※ 引述《lin25 (鲨鱼~!)》之铭言:
: : 因为小弟的论文有一部份要用到抓取网页文字的java程式
: : 所以参考了很多人写的抓取网页文字程式
: : 目前看过的方法是透过分析网页的html档之後 再将文字过滤出来
: : 但是现在的问题点就是我想要抓取的网页文字不在该网页的html档里
: : 像是Gmap帮你做的路线规划
: : 图: http://f8.wretch.yimg.com/noobking0/5/1768420813.jpg
: 我想应该是这张吧
: http://www.wretch.cc/album/show.php?i=noobking0&b=5&f=1768420813&p=0
: 这些文字并不是 "不在网页的 html 档里",
: 只是藏在 Frame 里头没让你找到而已。
: 想知道这页的真实位址,
: 在这 frame 里头滑鼠右键选内容即可。
: 虽然这页绝对不是真正的 HTML,
: 而可能是 php, asp, jsp...等等,
: 但是送到 client 端时,你只需要把它当作普通的 html 处理即可。
可惜没有那麽单纯,
因为他是 javascript 另外送的 request
http://farm4.static.flickr.com/3548/3283235099_4ee7619cc3_o.png
自己抓可能会有点麻烦,
看看 google map 有没有直接的 API 吧
--
※ 发信站: 批踢踢实业坊(ptt.cc)
◆ From: 140.112.168.163
1F:推 tkcn:唔 我想得太单纯了 谢谢指教 02/16 13:40
2F:推 TonyQ:Just do what the browser do. XD 02/16 14:24
※ 编辑: qrtt1 来自: 140.112.168.163 (02/16 15:41)