作者bokxko1023 (bokxko1023)
看板Python
标题[问题] 处理categorical资料及missing values方
时间Mon Feb 27 17:32:26 2017
我在练习使用sklearn套件来进行机器学习
目前使用的资料是一个3万多笔的资料(14 features)
而14个特徵里面有8个categorical的栏位
像是性别、婚姻状况等等,都是字串的形式
我目前是使用pd.read_csv(),再用a = a.values把型态转成array
(因为我发现使用genfromtxt的话所有字串都会变Nan)
可是在用imputer处理missing value时,会出现错误:could not convert string to
floa
使用imputer的程式码: imp = imputer(), data = imp.fit(data)
至於处理categorical资料的方法,我查到的是:
enc = preprocessing.OneHotEncoder()
enc.fit(data)
但是因为在imputer时就先卡住了,所以还不知道这个方法对不对
(有missing value的话就无法使用enc)
请问大家:
1.我的imputer哪里写错了呢?
2.汇入资料後的第一个步骤都是去除missing value对吗?
3.我查到的处理categorical的方法是对的吗?
4.资料的第一行column名有需要删除吗?例如: age,income等
谢谢大家耐心看完,麻烦各位了!
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 122.116.222.230
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/Python/M.1488187948.A.3A3.html