作者qas612820704 (Lego)
看板Python
标题[问题] 爬网页 包含图片,css,js
时间Tue Mar 10 17:14:37 2015
我想要把网页的页面包含里面的图片,css,js都载下来
我Google了半天 我都只找到 只爬网页的内容下来
只有爬网页下来 但是我想一并连local的css js 一起载下来
像是firefox Ctrl+S 载下来的东西 可是要载的有点多
无办法一个一个用firefox载
请问有什模办法可以达成吗?
--
1F:→ MOONRAKER: 把他删掉不就知道了08/23 23:37
2F:→ MOONRAKER: 不知道某一行在干嘛,就把他删掉,再跑一次08/23 23:38
3F:→ MOONRAKER: 不知道脚踏车座垫有什麽用,把他拔掉骑一次就知道了08/23 23:39
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 140.120.73.126
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/Python/M.1425978882.A.FDE.html
4F:→ IAMPF: wget -p <url> 03/10 17:55
5F:→ mars90226: 你是想用Python写,还是一般工具? 03/10 18:49
6F:→ mars90226: 用Python的话,你要自己针对每一个连结去把他载下来 03/10 18:50
7F:→ mars90226: 浏览器在做的事也是看到连结以後再去下载 03/10 18:50
8F:→ qas612820704: 那有什摸套件 可以用吗? 03/10 19:56
9F:→ qas612820704: 我用requests只有html file 03/10 19:58
10F:推 yan12125: 如果不限纯python可以试试看phantomjs 03/10 21:18
11F:→ qas612820704: 我是要用django来写这个功能 所以希望是python或是 03/11 00:23
12F:→ qas612820704: 可以用command去call的方法 03/11 00:23
13F:→ u1240976: 用 beautifulsoup 去把 html file 的 css/js 的 url抓出 03/12 00:57
14F:→ u1240976: 再个别 request 每个 url 就可以抓到 03/12 00:58
15F:→ u1240976: 基本上浏览器也是这样做,每个档案都要个别发httprequest 03/12 01:01