作者FSGuitar (fingerstyle)
看板Statistics
標題[問題] 是否有更有效的配對方法?
時間Sun Oct 14 15:29:42 2012
我有3000人的資料
這3000人會與另一個資料庫做配對
目的是從另一個資料庫找出和這3000人年齡和性別配對的9000人
(也就是1:3, 1個人配3個年齡性別都一樣的人)
http://www2.sas.com/proceedings/sugi29/173-29.pdf
我參考這篇進行配對
但是有很大的問題
雖然配對出來的結果有數十萬筆
甚至我把年齡範圍拉大
可以配出5000萬筆的control
問題來了
由於1個case會配到非常多個control
但這些control用sql的語法是會重複的!
也就是case 1 和case 2的control會有很多的重複
按照那篇的方法 可以用proc sort 後面 + nodupkey解決
也就是把control中有重複的都移除
但是我發現這個方法會把我的case也刪掉了!
也就是sas在移除的時候 sas只考慮control有沒有重複的問題
有重複就刪掉
但是也因為這樣 某些case可能剛好自己的對照組全都有跟別的case有重複
結果那些case就被刪掉了
不知道像這樣的問題
是否有辦法能解決呢
也就是在刪除的過程中
希望case還能保存3000
--
※ 發信站: 批踢踢實業坊(ptt.cc)
◆ From: 140.112.4.184
1F:推 imaltar:應該是第一次配對完成後 例如有2900個case配到了 10/14 21:09
2F:→ imaltar:再用剩下的100個case去配剩下的control 你要改成macro來寫 10/14 21:10