作者gigigigi (gigigigi)
看板Python
标题[问题] pandas read_html 分析栏位问题
时间Sun Apr 2 13:42:02 2017
https://www.sendspace.com/file/ysmnfn
上面是我的程式码跟测试档案aa.html
我在使用pd.read_html 过滤html里面出表格发现我aa.html 用浏览器看有两个表格
但是程式用 pd.read_html 分析出来只有一个表格
想请问一下这是什麽原因?
谢谢
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 175.181.186.197
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/Python/M.1491111726.A.35D.html
1F:→ s860134: #1OjKCMQn 个人猜测又跟 parser 的爬法有关系拉... 04/02 15:25
2F:→ gigigigi: 这是爬法造成?不过看上面文章感觉是html语法问题造成 04/02 16:52
3F:→ gigigigi: pd.read_html 的 parser 失败 04/02 16:52
4F:→ s860134: 看你怎麽看啦,看你觉得是工具不好使,还是资料不符工具 04/02 16:57
6F:→ gigigigi: 请问哪边看出问题 ?? == $0 嘛? 04/02 23:44
8F:→ gigigigi: 请问有什麽方法或是工具可以检查出html 问题的地方嘛? 04/02 23:46
9F:→ zerof: ....一个<table>里面只能有一个<thead>跟<tbody> 04/03 01:02
10F:→ zerof: 这也是为什麽pd read_html 只会出现上半部(之後的两个tag是 04/03 01:03
11F:→ zerof: 不合法的 04/03 01:03
12F:→ gigigigi: 了解! 感谢... 我试试看用soup拆解出来在丢到pandas 04/03 02:22