作者ching0629 (Syameroke)
看板Statistics
标题[问题] 在GEE中的遗漏值该如何处理
时间Wed Aug 1 11:17:35 2012
最近使用GEE的时候遇到了一些问题,那就是GEE似乎会将任一变项有遗漏的观察值删去
简单的说,假设变项有A,B,C三个(假设接类别)
ID A B C
观察值1 1 0 .
观察值2 0 . 1
观察值3 1 . 0
观察值4 0 1 .
观察值5 . 1 1
(.代表missing)
这样观察值1到观察值5全部都不会被纳入模式中分析
这个问题困扰着我,我试着用模拟数据将遗漏值填上其他数字,但结果好像会导致系数估计
值的不准确
如下列的模拟数据
ID 次数 依变项 自变项1 自变项2
101 0 50 0 0
101 1 47 0 0
102 0 45 0 1
102 1 40 0 1
103 0 45 0 1
103 1 40 0 1
104 0 40 1 0
104 1 32 1 0
105 0 35 1 1
105 1 22 1 1
106 0 40 1 0
106 1 32 1 0
107 0 35 . 1 自变项1其实为1
107 1 25 . 1 自变项1其实为1
108 0 50 . 0 自变项1其实为0
108 1 47 . 0 自变项1其实为0
模式包含下列变数:
次数, 自变项1, 自变项2, 自变项1*次数, 自变项2*次数, 自变项1*自变项2*次数
我希望计算出来的数值为(都用1与0相比):
次数=-3
自变项1=-10
自变项2=-5
自变项1*次数=-5
自变项2*次数=-2
自变项1*自变项2*次数=-3
使用此一模拟数据,若删除遗漏值则可以得到我想要的答案,但若随便将遗漏值填上2,则会
使结果出现完全不同的答案,因为2这个类别混杂了0和1
因此希望求助於各位,看有没有什麽好的方法能够解决此一问题,因为小弟需要执行的任务
可能有将近1000个自变项,原始的资料仅有2600笔观察值左右,若删除了任一变项有遗漏的
观察值,剩不到1000个
--
※ 发信站: 批踢踢实业坊(ptt.cc)
◆ From: 210.60.122.8
1F:→ bmka:what's wrong with conducting a complete-case analysis? 08/01 11:48
2F:→ ching0629:简单的说我希望像Linear regression那样,遗漏不需要删除 08/01 13:27
3F:→ FSGuitar:Linear regression不会删吗@@? 我记得也会耶 08/01 22:21
4F:→ ching0629:有方法可以成对排除之类的... 08/02 00:09