作者FSGuitar (fingerstyle)
看板Statistics
标题[问题] 是否有更有效的配对方法?
时间Sun Oct 14 15:29:42 2012
我有3000人的资料
这3000人会与另一个资料库做配对
目的是从另一个资料库找出和这3000人年龄和性别配对的9000人
(也就是1:3, 1个人配3个年龄性别都一样的人)
http://www2.sas.com/proceedings/sugi29/173-29.pdf
我参考这篇进行配对
但是有很大的问题
虽然配对出来的结果有数十万笔
甚至我把年龄范围拉大
可以配出5000万笔的control
问题来了
由於1个case会配到非常多个control
但这些control用sql的语法是会重复的!
也就是case 1 和case 2的control会有很多的重复
按照那篇的方法 可以用proc sort 後面 + nodupkey解决
也就是把control中有重复的都移除
但是我发现这个方法会把我的case也删掉了!
也就是sas在移除的时候 sas只考虑control有没有重复的问题
有重复就删掉
但是也因为这样 某些case可能刚好自己的对照组全都有跟别的case有重复
结果那些case就被删掉了
不知道像这样的问题
是否有办法能解决呢
也就是在删除的过程中
希望case还能保存3000
--
※ 发信站: 批踢踢实业坊(ptt.cc)
◆ From: 140.112.4.184
1F:推 imaltar:应该是第一次配对完成後 例如有2900个case配到了 10/14 21:09
2F:→ imaltar:再用剩下的100个case去配剩下的control 你要改成macro来写 10/14 21:10