作者fealing (fealing)
看板Python
标题[问题] 台银网页爬虫
时间Fri Apr 14 17:55:10 2017
各位前辈大家好
最近练习爬虫写BeautifulSoup
主要是只想要抓取台银网页,货币及现金汇率(本行卖出)就好
目前是可以抓到资料,但是货币那栏的值一直都是置中
但是我只想要单纯的文字就好,不要置中QQ
以下是code,还请各位前辈帮忙指教
import requests
from bs4 import BeautifulSoup
res = requests.get('
http://rate.bot.com.tw/xrt?Lang=zh-TW')
soup = BeautifulSoup(res.text,'html.parser')
Currency = soup.find_all(class_='hidden-phone print_show')
Rate = soup.find_all(class_='rate-content-cash text-right print_hide')
for x in range(0,18):
print(Currency[x].text)
print(Rate[x*2+1].text)
输出结果:
美金 (USD)
30.572
港币 (HKD)
3.953
英镑 (GBP)
38.89
澳币 (AUD)
23.35
加拿大币 (CAD)
23.17
新加坡币 (SGD)
22.01
瑞士法郎 (CHF)
30.61
(列出几行参考结果....)
另外想请问大家一个问题
抓取网页时 .content / .string / .text有什麽不同呢?
目前还是新手,如果问题很烂,还请大家多多包涵
谢谢大家
※ 编辑: fealing (125.227.157.49), 04/14/2017 17:56:18
1F:推 PttBot9527: strip()? 04/14 18:02
2F:→ lambo: 因为他本来就有很多空白..... 04/14 23:06
3F:→ jn8029: 同一楼 print(Currency[x].text.strip()) 04/14 23:10
4F:→ fealing: 非常感谢楼上各位版友的帮忙,终於可以了,谢谢 04/15 13:02
5F:推 ntumath: contents:把一阶子标签拆开整理成list 04/15 15:36
6F:→ ntumath: string:只针对只有一个子标签在用,取得里面的string 04/15 15:37
7F:→ ntumath: text:把所有子标签内的string合并成一个string 04/15 15:38
8F:推 tentenlee: 台银网页不是可以取CSV格式?? 04/16 16:25