作者chibamo (机掰毛)
看板Statistics
标题Re: [问题] 回归的R-square值
时间Thu Jan 17 13:16:50 2008
※ 引述《dick0631 (立志打败邪恶的ETS军团)》之铭言:
: ※ 引述《chibamo (机掰毛)》之铭言:
: : R-square你可以把他想像成correlation coefficient
: : 它衡量的是y与你的一堆x之间线性相关的程度
: : 所以那麽低肯定代表model是有问题的...
: : 也许关系不是线性,也许是时序资料
: : 你可以试着画一下scatter plot或用无母数的additive model画一下图
: 如果y,X 关系不是线性,用linear也不是不行。改成这个 y, lnX 模型,R^2增加了,
: 但意义大吗?
y, X关系不是线性硬当成线性做的话error term的期望不是0,
违反Guass-Markov condition,
做出来的结果不是unbiased,更不用讨论是不是BLUE,也不会consistent
如果y, lnX的R^2很高代表y, lnX可能有线性关系,
有些资料天生就是这样,硬套用y, X的模型反而不对。
如果都可以用原始的linear作的话我们也不用发展广义线性模型、无母数回归跟
半参数化模型了。
: 若改成 lny,X,R^2能比吗?(如你下一点说的)
: 如果是time series data,那麽R^2是不会这麽小的。显然原po用的data是cross section
: data吧!
: : R-square不是那麽重要的原因是不同资料或model的值无法互相比较
: : 就算有考虑变数个数做adjust之後还是不能比
: : 但是不代表值那麽低没有问题ˋ(′_‵||)ˊ
: R^2值低的问题在哪里?要不要说清楚一点?
: 假想一个例子,R^2-->1,能表示因果关系吗?
想想R^2的定义,它比较的是我用这个模型估计的结果比起直接用平均数估计
用SSE做衡量标准进步了多少
所以R^2太低代表我这个模型根本没比直接用平均数好多少
那我干嘛用这模型?
另外回归本来就不能表示因果关系,因果关系需要在实验上设计
那是casual inference探讨的问题。
--
※ 发信站: 批踢踢实业坊(ptt.cc)
◆ From: 125.225.73.50