作者lin25 (鲨鱼~!)
看板java
标题Re: [问题] 如何抓取网页上的文字
时间Thu Feb 19 16:42:07 2009
※ 引述《tkcn (小安)》之铭言:
: ※ 引述《lin25 (鲨鱼~!)》之铭言:
: : 因为小弟的论文有一部份要用到抓取网页文字的java程式
: : 所以参考了很多人写的抓取网页文字程式
: : 目前看过的方法是透过分析网页的html档之後 再将文字过滤出来
: : 但是现在的问题点就是我想要抓取的网页文字不在该网页的html档里
: : 像是Gmap帮你做的路线规划
: : 图: http://f8.wretch.yimg.com/noobking0/5/1768420813.jpg
: 我想应该是这张吧
: http://www.wretch.cc/album/show.php?i=noobking0&b=5&f=1768420813&p=0
: 这些文字并不是 "不在网页的 html 档里",
: 只是藏在 Frame 里头没让你找到而已。
: 想知道这页的真实位址,
: 在这 frame 里头滑鼠右键选内容即可。
: 虽然这页绝对不是真正的 HTML,
: 而可能是 php, asp, jsp...等等,
: 但是送到 client 端时,你只需要把它当作普通的 html 处理即可。
这几天一直在研究google map api 以及如何用java做网页
但....问题在刚刚解决了
解决的关键就是我阅读别人网页"如何在无名部落阁嵌入Google Map"的过程中
http://briian.com/?p=2628
发现我之前抓的网址并非真的google map路线规划网址
google map路线规划的内容 还是写在他真的网址里的html里
而在测试多个google map路线规划後
发现跟tkcn大讲的一样 真的html写在原本的html里
所以目前是打算分两步骤抓取路线规划资料内容
1.从原本的google map html里抓取 路线规线规划的html
有特徵:
a.
http://maps.google.com/maps?f=d&source=embed&saddr=%E5%A4%A7%E5%90%8C%E5%A4%A7%E5%AD%B8&daddr=%E5%8F%B0%E7%81%A3%E5%8F%B0%E5%8C%97%E7%B8%A3%E6%B0%B8%E5%92%8C%E5%B8%82&hl=zh-TW&geocode=&mra=ls&dirflg=w&sll=25.038483,121.504154&sspn=0.073254,0.109863&ie=UTF8&t=h&ll=25.065853,121.513596&spn=0.03864,0.054932&z=14
b.
http://maps.google.com/maps?f=d&source=s_d&saddr=%E5%A4%A7%E5%90%8C%E5%A4%A7%E5%AD%B8&daddr=%E5%A3%AB%E6%9E%97%E5%8D%80%E5%B0%8F%E5%8C%97%E8%A1%97&hl=zh-TW&geocode=&mra=ls&dirflg=w&sll=25.055123,121.525784&sspn=0.077288,0.109863&ie=UTF8&t=h&z=14
都是http开头 z14结尾 透过这两个特徵应该可以简单的抓取
2. 在从路线规划的html里抓取路线规划资讯内容
呼 感谢大家的教导了
如果有人发现更简单的抓取方式 麻烦告知我
我程式码写完或有任何何问题会在来分享以及请教
感恩
--
※ 发信站: 批踢踢实业坊(ptt.cc)
◆ From: 140.129.19.118