作者gsuper (绿色苏打心)
看板Statistics
标题Re: [问题]ANOVA是如何同时比较"变异数"和"平均数"
时间Thu Jun 5 21:34:15 2008
後来听从版上的大大所说的
我专注在原始理论的部份
才发现我先前的问题都不是问题
ANOVA本身的前提就可以否定我自己提出的极端例子
------------------------------------------------------------------
可是
原始理论我有个重点不能理解
就是有关 MSt的定义 (迷之嘘:那你不就是
一知半解吗? 答:我能说啥?
----------------------------推导开始----------------------------------
先设计一个状况
N = 12 (总data数12个 也就是12个 Xij
k = 3 (组数3组
n1 = n2 = n3 = 4 (3组里面的data各有4个
3组常态分布的samples
Variance没有显着差异
因此
可以很简单的取得 s1^2 s2^2 s3^2
比照 Unpaired t test with pooled variance (Sp^2)
我尝试去推导这个 ANOVA table 的 Sp^2
以下为推导过程 高手请略过
v1(s1^2) + v2(s2^2) + v3(s3^2)
______________________________ <- 这条横线是除法符号 (冏....
Sp^2 =
v1 + v2 + v3
= (CSS1 + CSS2 + CSS3) / (N-k)
= SSerror / (N-k)
= MSe
= σ^2 (这样写不太对我知道....我只是想陈述理论...
= 母体变异数的 estimator
所以 MSe 的意义为
pooled variance of treatments
(这短短几行花了我一整个下午去想 XDD)
尤其是要帮 MSe 定义真是太辛苦了
---------------OK MSe 的意义已经很清楚了
现在的问题就是MSt的定义了------------------
经过我的苦思
Sp^2 究竟要跟谁去比较 ?
答案当然是 MSt
可是MSt究竟是什麽?
非常非常努力思考过以後
我发现从常态分布的假设里面
可以得到以下的逻辑关系
_ _ _ _
1. 3组样本可以抽取出3个 Xi. ( X1. X2. X3.)
_
2. 3个 Xi. 可以代入一个 sampling distribution
3. 这个 sampling distribution 也是常态分布
4. sampling distribution 的标准差
原始data 的标准差
有
standard error 的关连性
想明白了这点以後
我开始尝试去生产 sampling distribution 的 standard error
However !
以我残破可怜的统计程度 (生统...很虚...
我不知道该怎麽生产
pooled standard error <---这是我自创的名词不好意思...
因为我推测
MSt 是从 standard error 生产出来的玩意....
我嚐试了以下几种算法
1. Sp^2 / N (直接用 Sp^2 转换成sampling distribution的standard error
2. Sp^2 / k
s1^2 * v1 + s2^2 * v2 + s3^2 * v3
3. ___________________________________ 除以 N (样本变异数加权以後
再转换成
v1 + v2 + v3 standard error
s1^2 * v1 + s2^2 * v2 + s3^2 * v3
4. ___________________________________ 除以 k
v1 + v2 + v3
s1/n1^0.5 * v1 + s2/n2^0.5 * v2 + s3/n3^0.5 * v3
5. __________________________________________________ (算完各自的
standard error
v1 + v2 + v3 再进行加权
_ _ _ _ _ _
(X1.-X..)^2 + (X2.-X..)^2 + (X3.-X..)^2
6. __________________________________________
( k - 1 )
_ _ _ _ _ _
(X1.-X..)^2 * v1 + (X2.-X..)^2 * v2 + (X3.-X..)^2 * v3
7. _________________________________________________________
v1 + v2 + v3
经过了一番混战之後 (约4个小时吧...
我发现一件事
不管哪一种算法都不能推导出 MSt
而且我还不知道哪一种算法是正确的 超想哭....
---------------------------------------------------------------------
问题总结
1. MSt 到底怎麽来的?
2. MSt 的正确定义究竟是什麽?
3. pooled standard error 究竟要怎麽取得?
----------------------------------------------------------------------
如果您看不懂我在说什麽...
绝对是我的表达方式不好... sorry
但是我尽力了....
--
※ 发信站: 批踢踢实业坊(ptt.cc)
◆ From: 61.231.236.46
※ 编辑: gsuper 来自: 61.231.236.46 (06/05 21:38)
※ 编辑: gsuper 来自: 61.231.236.46 (06/05 21:46)
※ 编辑: gsuper 来自: 61.231.236.46 (06/05 21:57)
※ 编辑: gsuper 来自: 61.231.236.46 (06/05 22:02)
※ 编辑: gsuper 来自: 61.231.236.46 (06/05 22:24)
※ 编辑: gsuper 来自: 61.231.236.46 (06/05 22:25)
1F:→ gsuper:其实最後7种算法 1st=3rd 2nd=4th 我居然没发现 06/05 22:28
※ 编辑: gsuper 来自: 61.231.236.46 (06/05 22:47)
2F:推 asaba:原PO 我觉得你应该买本中文统计课本看一下 囧 06/05 22:57
3F:→ asaba:ANOVA中 k=2时 就是两常态母体平均数是否相等的混合T检定 06/05 23:05
4F:→ asaba:所以Sp^2是跟MSE一样的东西 06/05 23:06
5F:→ gsuper:Yes! 我就是这麽想的...但是 MSt 在unpaired t 里面 06/05 23:09
6F:→ gsuper:是没有的...所以我才无从推导起.... 06/05 23:09
※ 编辑: gsuper 来自: 61.231.236.46 (06/05 23:10)
7F:→ asaba:MSTR再K=2时 =SSTR 把他展开再除MSE 用SP^2的方式写 就OK了 06/05 23:16
^^^^^^^^^^^^^^^^^ ^^^^^^^^^^^^^^^ ^^^^^^^^^^^^^
懂 为什麽要这样做? 转换是怎麽做?
(感觉有前进一点了....可是还是没有很了解....)
※ 编辑: gsuper 来自: 61.231.236.46 (06/05 23:31)
8F:→ asaba:T分配是Z/根号"卡方(v)" 平方以後就是 Z^2/卡方(v) 06/05 23:53
9F:→ asaba: 要除自由度v忘了打... 06/05 23:54
10F:→ asaba:又Z^2等於卡方(1) 所以原式= [卡方(1)/1]/[卡方(v)/v] =F 06/05 23:55
^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
天书.....
11F:→ asaba:所以k=2时 你可整理 把F = MSTR/MSR = SSTR/MSE 06/06 00:12
12F:→ asaba:=SSTR/Sp^2 = T^2 06/06 00:12
^^^^^^^^^^^^^^^^^^
後劲很强....计算起来超合理的
但是还差一个定义问题 _
MSt是要量化 ( X - u )^2 这个东西吗?
(based on t test.....
不过我已经搞不清楚现在究竟是 population distribution
还是 sampling distribution
※ 编辑: gsuper 来自: 61.231.236.46 (06/06 00:33)
13F:→ asaba:原PO不知道那些统计量之间的关系的话 06/06 01:08
14F:→ asaba:自己要转换的话 会有一点点难度@@ 06/06 01:08
15F:→ lin15:对... 06/06 01:10
16F:→ asaba:MSTR最後可以变成(X1bar+X2bar)^2/(1/n1+1/n2) 06/06 01:10
^^^^^^^^^^^^^^^^^^^^^^^^^^^
_ _
这里的感觉是 pooled X (not X..)
而且 pooled的方式跟 bonferroni t很类似...
17F:→ asaba:MSE=Sp^2 就是[(n1-1)S1^2+(n2-1)S2^2]/n1+n2-2 06/06 01:11
18F:→ asaba:相除以後 就是混合T统计量的平方 06/06 01:11
※ 编辑: gsuper 来自: 61.231.236.46 (06/06 01:28)
19F:→ asaba:原PO 你应该要先知道把SSTO分成SSE跟SSTR的意义是什麽... 06/06 09:18
20F:→ asaba:除以分别的自由度 就是从平方合变成均方合 06/06 09:29
21F:→ asaba:也就是变成了两个卡方... 这可以证明 然後相除变F 06/06 09:33
所以我的问题应该就是不懂
F = t^2 吧... (when k = 2)
请问这是在哪方面的章节有提到?
我当初在念 F 和 t 的时候都没看过这个等式...
※ 编辑: gsuper 来自: 61.231.236.46 (06/06 14:03)
※ 编辑: gsuper 来自: 61.231.236.46 (06/06 14:56)
22F:→ asaba:这个应该是在ANOVA讲完以後都会提一下的吧 06/07 01:12
我的生统课本没提到
不过根据bmka大给的网址 还有 维机百科
都有提到这个等式
根据 F = t^2 (推导过程 unknown)
我只能暂时把 MSt 定义成这样
_ _
np (
Xp. - X..)^2 _
where np = pooled n Xp. = pooled mean of treatment
这两个东西又是我自创的了
我是把MSt理解为一个 "pool" 的过程
把 np 移项到 Sp^2 的分母以後
会变成 sampling distribution 的 t^2
_ _
where F =
MSt/MSe =
(Xp.- X..)^2 = t^2
_____________
Sp^2 /
np
可是没办法解释 MSt 的 pool 过程
------------------------------------------------------------
So far
我决定暂时封印ANOVA的推导了
虽然很想了解理论来源
可是程度不足实在没办法
感谢
bmka大大 和
asaba大大 的费心
※ 编辑: gsuper 来自: 61.231.247.229 (06/07 13:58)
※ 编辑: gsuper 来自: 61.231.247.229 (06/07 14:01)
※ 编辑: gsuper 来自: 61.231.247.229 (06/07 14:02)
※ 编辑: gsuper 来自: 61.231.246.12 (06/07 14:16)
23F:→ bmka:不必着急, 统计方法要多用才会有感觉 06/11 09:40
24F:→ bmka:如果不是科班出身的, 建议先玩玩data analysis 06/11 09:41
25F:→ bmka:受过比较多数学训练的人,读统计比较轻松, 但也未必能读得好 06/11 09:44
26F:→ bmka:主要就是能不能抓住统计的直觉性 06/11 09:44