作者DearYoyoDon (yoshito)
看板Python
标题[问题] 爬网页抓影片的疑问
时间Thu Apr 21 18:15:32 2016
各位板友好,
最近看youtube教学
练习用Python抓图片、影片、分析网站
import requests
res = requests.get('
http://www.maplestage.com/episode/139279/%E4%B8%80%E8%A2%8B%E5%A5%B3%E7%8E%8B+20160420+%E9%81%93%E9%AB%98%E4%B8%80%E5%B0%BA+%E9%AD%94%E9%AB%98%E4%B8%80%E4%B8%88+%E5%A4%AB%E5%A6%BB%E7%94%9F%E6%B4%BB%E8%AB%9C%E5%B0%8D%E8%AB%9C!/')
print res.text
我是找maplestage练习抓上面的影片
像上面的影片是dailymotion的
可是在res.text里面内容找不到相关的影片连结
小弟不太懂网页里面语言
所以试了很就可是还是无法成功
所以想知道是不是有方法找到影片的连结来下载
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 140.113.33.62
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/Python/M.1461233734.A.825.html
1F:推 busystudent: 几个问题希望你回答,你这网页里有许多影片,请问你要 04/21 18:21
2F:→ busystudent: 抓哪支影片? 04/21 18:21
3F:推 busystudent: 所以你目标是抓影片联结还是下载影片? 04/21 18:24
4F:→ DearYoyoDon: 希望能直接抓下影片,例如能下载某个节目某一集 04/21 18:35
6F:→ aweimeow: ptt站方不给贴 ppt.cc 只好贴 goo.gl 的 orz 04/21 20:10
7F:→ DearYoyoDon: 存取遭到拒绝耶@@?! 04/21 20:10
9F:→ aweimeow: 呃,我知道原因了 04/21 20:14
10F:→ aweimeow: 我换了个 IP 再去存取这个网址是 403 04/21 20:14
11F:→ aweimeow: 他那个网址是只能让我的 IP 存取,所以你才会 forbidden 04/21 20:14
13F:→ aweimeow: 你找看看罗,找的到影片网址下载就容易了 04/21 20:17
14F:→ DearYoyoDon: 那用什麽解析这些网址,这是能转换的吗? 04/21 20:37
15F:→ DearYoyoDon: 你图片里上面那一行的网址里面的HTML就可以只接找到 04/21 20:40
16F:→ DearYoyoDon: mp4的连结 04/21 20:40
17F:推 aweimeow: 可以试试 lxml 然後用 xpath 来找到你要的东西 04/21 20:45
18F:→ aweimeow: BeautifulSoup 好像也可以,但是我没有用过 04/21 20:46
19F:→ DearYoyoDon: 非常感谢,我一开始试soup但是总觉得好像转换後有些 04/21 20:55
20F:→ DearYoyoDon: 找不到,不过我现在是先从网站里面找到.../embed/.. 04/21 20:56
21F:→ DearYoyoDon: 的影片连结,再从新的网站去找下载连结 04/21 20:56
22F:→ DearYoyoDon: 有点麻烦,但是先这样做,希望版友能指点 :) 04/21 20:57