作者goofi0211 (姑叔城外含三次)
看板Python
标题[问题] 新手爬虫爬开放式政府网站遇到困难
时间Thu Nov 23 01:21:51 2017
最近在爬一个法学网站的资料
网址是
http://jirs.judicial.gov.tw/FJUD/index_1.htm
选择司法院--刑事补偿 判决日期选择106年 按查询就会进到查询页面
但这时候问题就来了,我的爬虫看到的页面似乎跟网页所显示的不太一样
<frameset cols="220,*" frameborder="no" border="0" framespacing="0">
<frame src="FJUDQRY02_1.aspx?courtFullName=&v_sys=&jud_year=&jud_case=&jud_no=&jud_no_end=&jud_title=&keyword=&sdate=&edate=&page=&id=&searchkw=&v_booktype=&deepsearch=&jmain=&JSTOCK=&JDG_COMMIS=&JDG_PRESID=" name="leftFrame" scrolling="auto" noresize="noresize" id="leftFrame" title="leftFrame"> <frame
src="FJUDQRY02_1.aspx?courtFullName=&v_sys=&jud_year=&jud_case=&jud_no=&jud_no
_end=&jud_title=&keyword=&sdate=&edate=&page=&id=&searchkw=&v_booktype=&deepse
arch=&jmain=&JSTOCK=&JDG_COMMIS=&JDG_PRESID=" name="contentFrame" id="content
Frame" title="contentFrame"> </frameset>
上面这是我爬虫所看到的部分而我想去的真正网站是src後面那串,我试过直接用爬虫
抓取src那一段再用新分页开启他,但这样浏览器好像会挡
小弟才疏学浅还请大家多帮忙
以下是小弟的程式码
from selenium import webdriver
from selenium.webdriver.common.keys import Keys
import time
driver = webdriver.Chrome(executable_path=r'/Users/terry/chromedriver')
driver.get("
http://jirs.judicial.gov.tw/FJUD/FJUDQRY01M_1.aspx")
driver.find_element_by_name("dy1").click()
driver.find_element_by_name("dy1").clear()
driver.find_element_by_name("dy1").send_keys("106")
driver.find_element_by_name("Button").click()
time.sleep(5)
soup=bs(driver.page_source,'html.parser')
elem=soup.select('frameset frame')
url='
http://jirs.judicial.gov.tw/FJUD/'+elem[1]['src']
driver.get(url)
driver.find_element_by_link_text(u"106,台重覆,13").click()
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 180.217.185.101
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/Python/M.1511371315.A.AA0.html