作者unhumanWu (阿文)
看板Python
标题Re: [问题] 爬虫RequestURL的取得
时间Mon Oct 9 09:51:42 2017
※ 引述《unhumanWu (阿文)》之铭言:
: 大家好,初学爬虫
: 最近在蒐集以下网址店点相关资讯
: https://www.aptg.com.tw/store/
: 我是透过区域查询(县市及乡镇市区)的方式来搜寻店点
: 发现他每个乡镇市区都会回传不同的Request URL
: 各行政区的Request URL长相大概像下面这样:
: https://imgur.com/a/9qK7J
: 想请教有没有方法可以知道网站全部行政区的Request URL
: 感恩!
类似的状况也发生在下面的网址
就是不同行政区回传不同的Resquest URL
虽然可以手动查,但想知道也没有其他方法
感恩~
https://www.tstartel.com/CWS/storeLocation.php
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 220.136.66.131
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/Python/M.1507513905.A.9F4.html
1F:→ s860134: F12 直接看他 js source code 10/09 10:06
2F:→ s860134: 他把原始码都放在上面了,你 try 几个应该就有了 10/09 10:10
3F:→ uranusjr: %E4%B8%AD%E6%AD%A3%E5%8D%80 => 中正区 的 URL encoded 10/09 14:46
4F:→ uranusjr: format, 以下都是一样, 可以直接用 urllib.parse 转换 10/09 14:46
5F:→ uranusjr: %E5%8F%B0%E5%8C%97%E5%B8%82 => 台北市 10/09 14:47
结果我後来土法炼钢把各个城市的encode抓出来
https://imgur.com/wEYBDhe
但如果项目太多就伤脑筋了
来研究一下urllib,感恩
※ 编辑: unhumanWu (220.136.66.131), 10/09/2017 19:01:36
7F:→ s860134: python3 只要 urlib, python2 散布在 urlpares 和 urlib 10/10 07:39
推,原来是这个意思
※ 编辑: unhumanWu (220.136.38.63), 10/10/2017 09:06:50
※ 编辑: unhumanWu (220.136.38.63), 10/10/2017 09:17:18