作者ckcy ( )
看板Python
标题[问题] 网页爬虫 读不到完整资料
时间Wed Jan 25 22:33:09 2017
大家好
我想读下面网页的表格
http://pchome.megatime.com.tw/stock/sto3/ock1/sid6505.html
虽然在在document的sid6505.html里看得到需要的资料
但是程式读出来却读不出来
只能读到下面几行
想请教这个问题该如何解决 非常谢谢
<html>
<head>
</head>
<body>
<form id='submit_form' name='submit_form'
action='
http://pchome.megatime.com.tw/stock/sto3/ock1/sid6505.html'
method='post'>
<input type='hidden' name='is_check' value='1' />
</form>
<script type="text/javascript">
document.getElementById('submit_form').submit();
</script>
</body>
</html>
程式码:
import requests
res =
requests.get("
http://pchome.megatime.com.tw/stock/sto3/ock1/sid6505.html")
print (res.text)
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 123.192.239.185
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/Python/M.1485354796.A.810.html
※ 编辑: ckcy (123.192.239.185), 01/25/2017 22:57:26
1F:→ Neisseria: 那个网站是用 JS 生成的,只用 requests 会爬不到 01/25 23:38
2F:→ Neisseria: 要用 Selenium 或其他类似的工具才爬得到 01/25 23:39
3F:→ s860134: 不太对喔,是你 header 没给对,所以他把你挡掉罗~ 01/26 00:40
4F:→ s860134: 测了一下,server 检查的是 'Referer' 这个 header 01/26 00:46
6F:→ Neisseria: 歹势,搞错了 @@ 01/26 04:27
7F:→ ckcy: 谢谢s大!! 问题解决了 01/26 21:00