作者alpe (薛丁格的猫)
看板PHP
标题Re: [请益] preg_match_all的问题
时间Fri Dec 28 09:59:45 2007
※ 引述《AMOUAMOU (AMOU)》之铭言:
: E%B6%E5%A5%BD&fr2=tab-web
: 而我想抓搜寻页面里面的各个连结和分页连结
: 我发现到连结都是由
: <a href="http://tw.wrs.yahoo.com/_ylt=A8tUxyqKvHNHHy4AQQNw1gt./SIG=
: 12f1n7o30/EXP=1198853642/**http%3A//
: tw.news.yahoo.com/article/url/d/a/071128/1/ozs4.html" target=_blank>
: 且当我在抓分页连结的时候,尝试了很多种判断方法,都无法顺利抓到,好像在判断
: _底线的时候出了问题,我就算使用了[_]也没办法解决,我在这方面是新手,希望各位
: 大大可以指导我,非常感谢!!
'/<a
.*href=
(["|\'])([^\\1]*?)\\1/im'
一行太短. 所以加点注解/
.*
=> 防止中间有什麽 class xx oo 的东西.
(["|\']) 最好用[\"|\']
=> 抓出是用 ' or " 作开头...
[^\\1]*?
=>不是 开头的 " or ' 所有字符
*? greek match
\\1 结尾的 ' or "
如果 200% 确定 他们不会用 ' 当开头那就 href="([^"]*)"
搞定收工
--
Exactly. For that one fraction of a second, you were open to options
you had never considered. THAT is the exploration that awaits you:
not mapping stars and studying nebulae,but
charting the unknown possibilities of existence.
Star Trek S7E26 "All Good Thing"
--
※ 发信站: 批踢踢实业坊(ptt.cc)
◆ From: 60.248.154.212
※ 编辑: alpe 来自: 60.248.154.212 (12/28 10:01)
1F:推 Turbine:好文 推一下 12/28 12:46
2F:推 AMOUAMOU:谢谢指教^^ 12/28 21:32
3F:→ bcse:挑错字,贪婪应该是greed XD 12/28 22:55
4F:→ alpe:@@ greed greed 好样的打成 希腊比对啦 12/31 11:26