作者sariel0322 (sariel)
看板Python
标题[问题] 想请问有更有效率的写法吗?
时间Sun Aug 24 14:05:40 2014
我想把一个列数相当多的csv档案
把里面重复的列数给删除掉
我只能想到这种写法:
import csv
rows = []
a = 0
o = open("output.csv","w")
f = open("input.csv","r")
for row in csv.reader(f):
rows.append(row[0]+","+row[1]+","+row[2]+","+row[3]+","+row[4]+","+row[5]+","+row[6]+","+row[7]+","+row[8]+","+row[9]+","+row[10])
for i in set(rows):
o.write(i+"\n")
f.close()
o.close()
但由於行数非常多,资料量也大(csv档案约400mb)
因此全部跑完可能需要五天(有写个计数器来大约计算过,为了节省空间没列出来)
想请问有没有更有效率的写法
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 182.234.196.206
※ 文章网址: http://webptt.com/cn.aspx?n=bbs/Python/M.1408860343.A.6B1.html
1F:推 LiloHuang: 如果重复的资料很多,应该可以不用先把资料放到list内 08/24 17:02
2F:→ LiloHuang: 提供一个做法也许不见得会变快 XD 08/24 17:03
3F:→ LiloHuang: import csv 08/24 17:04
4F:→ LiloHuang: uniqueSet = set() 08/24 17:04
5F:→ LiloHuang: o = open("output.csv","w") 08/24 17:04
6F:→ LiloHuang: f = open("input.csv","r") 08/24 17:04
7F:→ LiloHuang: for row in csv.reader(f): 08/24 17:04
8F:→ LiloHuang: line = ",".join(row) 08/24 17:04
9F:→ LiloHuang: if line not in uniqueSet: 08/24 17:05
10F:→ LiloHuang: o.write(line + "\n") 08/24 17:05
11F:→ LiloHuang: uniqueSet.add(line) 08/24 17:05
12F:→ LiloHuang: f.close() 08/24 17:05
13F:→ LiloHuang: o.close() 08/24 17:05
14F:→ LiloHuang: 有时候性能瓶颈是在硬碟本身,可以看看 CPU 是否有吃满 08/24 17:11
15F:→ LiloHuang: 毕竟 400mb 的 CSV 要跑到五天真的有点久了些... 08/24 17:12
16F:→ LiloHuang: 避免先放到 list 再转,至少可以省掉一次 O(n) 的浪费 08/24 17:19
17F:→ yjc1: 不考虑用shell的sort -n < input.csv | uniq > output.csv ? 08/24 20:41
18F:推 LiloHuang: 推 yjcl 的做法,虽然会动到资料先後顺序,但非常优雅! 08/24 21:10