作者liton (欧吉桑留学生)
看板Statistics
标题Re: [问题] Logistic不仅只是要一组最佳解
时间Fri Aug 19 23:02:08 2011
在这报告一下目前的解法
从整个流程来看,有以下流程
1.单变量--NR1WAY无母数要过
2.共变数--REG的VIF要过
3.多变量--Logist的ROC要过
4.Out-of-Sample验证---Bootstrapping要过
因为计算量真的太大了
目前的作法是每个流程都砍之外
另外就是变数分组
好处除了减少计算量之外,也可以避免多变量挑到变数全集中在某一类型的变数
以C(100,5)来说,如果分组
那麽就会有75,287,520 组,而且这还是变数最少的
如果分成五组,每组C(20,1)那麽变成20^5=3,200,000
-----
其实..现在VIF的计算就让我受不了了
※ 引述《liton (欧吉桑留学生)》之铭言:
: 标题: [问题] Logistic不仅只是要一组最佳解
: 时间: Tue Aug 16 17:13:43 2011
: Logisics的Selection有None, Forward, Backward, Stepwise, Score
: 但是我要的是符合ROC达到某一定程度下
: 所有的候选模型
: 请问SAS有办法产出吗?
:
: --
:
※ 发信站: 批踢踢实业坊(ptt.cc)
: ◆ From: 210.71.218.254
: 推 tew:应该是可以 08/16 18:46
: → gsuper:我用 stepwise 的方法 , 控制 model error 在 特定数值以下 08/17 01:52
: → gsuper:以AUC当performance , 挑出来的 model performance 在全排 08/17 01:53
: → gsuper:列组合的 0.1% 以下 , 用暴力法 coding 不太划算 08/17 01:54
: → gsuper:除非你要搞很贵的实验 , 那就全部暴力给他下去吧 08/17 01:55
: → liton:楼上说的只会挑出一组AUC最好的 但这组後面的BOOTSTRAPPING 08/17 10:00
: → liton:以及後面的USER TEST可能过不了 08/17 10:01
: → liton:coding不是问题,麻烦的是计算,例如我100个变数中要取出 08/17 10:23
: → liton:10个变数的组合 COMBIN(100,10)...这要算到什麽时候? 08/17 10:24
: → gsuper:我说的就是这种暴力法 R指令 combn(100,10) , combn(100,9) 08/17 12:47
: → gsuper:combn(100,i) {i属於 1~10} 08/17 12:48
: → gsuper:你可以试试看 Cohen`s d 这个指标, 计算时间比AUC少很多 08/17 12:51
: → gsuper:但两者的关联性在常态分布下很高 08/17 12:51
: → gsuper:reclassification 类的应该也是要算很久 (NRI和IRI) 08/17 12:52
: → gsuper:因为 NRI 在资料处理上有点麻烦 , IRI要积分 (同AUC) 08/17 13:34
: → liton:目前我想到的方法是先筛变数,例如单变量P>5%的直接砍了 08/17 14:26
: → liton:VIF或COV不符某一特定标准的也砍了 08/17 14:27
: → liton:剩下的才进入Logistics 08/17 14:28
: → gsuper:我是这样做 08/17 14:54
: → gsuper:1. 假设有 100 个 features , 先计算 AUC_FULL 08/17 14:55
: → gsuper:2. 先移除第一个 feature , 计算 99 markers 的 delta AUC 08/17 14:55
: → gsuper: delta_AUC = AUC_FULL - AUC_NESTED 08/17 14:57
: → gsuper:3. 将第一个放回去 , 把第二个拿掉 , 计算第二个 feature 08/17 14:58
: → gsuper: 的 delta_AUC 08/17 14:58
: → gsuper:算了....讲不清楚 08/17 14:58
: → liton:你说的是技术性coding的问题,我说的是如何减少计算组数 08/17 15:01
: → liton:例如C(10,2),你还是得算组,我思考的是如何只要算5组 08/17 15:25
: → tew:要不要先将解释变数先跑相关 如果有些便项相关高 08/18 13:20
: → tew:就从其中的变项挑最佳的 或者用因素分析缩减变项 08/18 13:21
--
※ 发信站: 批踢踢实业坊(ptt.cc)
◆ From: 118.167.169.87
1F:→ ADORIAN:很难找到一个 model selection 的方法, 其结果可以符合各 08/20 07:46
2F:→ ADORIAN:个 criteria (你所提的流程). 08/20 07:47
3F:→ ADORIAN:如果有的话, 我个人认为这应该不是个统计方法, 反而像是 08/20 07:48
4F:→ ADORIAN:在求一组最佳的解 (比较像是在做 data mining) 08/20 07:49
5F:→ ADORIAN:这样一来, 你所谓的 test 能不能过也不是很重要, 毕竟你要 08/20 07:50
6F:→ ADORIAN:的是最佳解, 不是个统计问题. 08/20 07:51