作者NCK (守备范围:18~25岁)
看板PHP
标题[请益] 抓取网页html原始码
时间Wed May 16 11:29:14 2007
急迫需要写只php来抓取某网页的html
以便作parse切出所需要的
参考 再到处乱找 结果改成四不像...
<html>
<head>
<meta http-equiv="Content-Type" content="text/html; charset=big5" />
<title>Network Programming Homework 3</title>
</head>
<body bgcolor=#CCC999 text="#FFFFFF">
<div align=center>
<font size="3">
<form method="get">
<tr><td><center>URL: <input name="URL" SIZE="40"></td></tr>
<tr><td><center><input type="submit" value="START"> <input type="reset"
value="RESET"></center></td></tr>
<?php
$url = $_GET['URL'].$_POST['words'];
$ch = curl_init(); //初始化curl,要准备开始抓网页
curl_setopt($ch, CURLOPT_URL, $url); //告诉url要抓的是第一行的网页
curl_setopt($ch, CURLOPT_RETURNTRANSFER, 1); //不要将抓回来的网页秀到萤幕上,
//等等我们要继续分析
$content = curl_exec($ch); //抓吧,然後将资料存到$content
curl_close($ch);
$html = htmlentities($content);
$tok = strtok($html, "<h3>posting history</h3>");
echo $tok;
?>
</form>
</font>
</div>
</body>
</html>
PHP网页 :
http://140.113.167.207/~nck/DM.php
输入网页 :
http://del.icio.us/url/bc2930ff48e6bb275511c3ea0b451c37?all
需要切出 右下角 posting history那一大块的tag资料
可是输出切出後的$tok内容却是 &l
想请问该怎样改才能达到功能呢??
第一次写php请多指教 谢谢!!
--
※ 发信站: 批踢踢实业坊(ptt.cc)
◆ From: 140.113.167.221
1F:推 foxzgerald:要达到什麽功能阿? 05/16 14:10
2F:推 NCK:就是想要从输入的网页取得html原始码来作parse 05/16 16:02
3F:→ NCK:htmlentities抓回来的html字串 用strtok()切出来的跟预期不同~ 05/16 16:04
※ 编辑: NCK 来自: 140.113.167.221 (05/16 16:16)