作者bmka (偶素米虫)
站内Statistics
标题Re: [问题] ANOVA 有常态分布的假设吗?
时间Sun Apr 17 00:10:09 2011
推 gsuper:我记得 2-way ANOVA 的假设 , 需要在 r*k 的 table 中 04/15 14:17
→ gsuper:直的看每条都要常态 , 横的看也都要常态 , 全部打散一起看 04/15 14:17
→ gsuper:仍然要常态 , 如果太不像常态分部 , 有时候 F会小於1 04/15 14:18
推 gsuper:SStotal(全)=SSblock(横)+SStreat(直)+SSresidual(残) 04/15 14:22
→ gsuper:照这逻辑来看,残差也要是常态分部based on全横直三项的运算 04/15 14:23
→ huggie:你的意思是全横直都常态分布的话,残差看来就要是常态了? 04/15 16:26
→ gsuper:恩,就是前三项符合常态,残差自然就是常态 04/15 16:36
上面这段话说得不对
Let X be a binary variable, and assume that
Y given X has a normal distribution.
Then, unconditioning on X, the marginal distribution
of Y is a mixture of two normal distributions.
In other words, when you pool data together and
ignore the information about X, the outcome
variable Y is not normally distributed (unless
X is independent of Y).
Apply the same argument to two way ANOVA:
"Y|(X1,X2)~ Normal" implies neither "Y|X1~ Normal" nor "Y~Normal".
"直的看每条都要常态 , 横的看也都要常态 , 全部打散一起看仍然要常态"
这句话完全错误
--
※ 发信站: 批踢踢实业坊(ptt.cc)
◆ From: 74.96.30.178
※ 编辑: bmka 来自: 74.96.30.178 (04/17 00:16)
1F:→ west1996:你好像误会了他的意思?? 04/17 00:21
2F:→ bmka:我的中文不好,那麽gsuper指的是?? 04/17 00:26
3F:→ gsuper:我的意思是 , 假设现在有 5 treatments(直) , 工厂一到五 04/17 01:46
4F:→ gsuper:又分成三种 blocks , 工作效率 低,中,高 04/17 01:47
5F:→ gsuper:先假设没有重复实验 (有也没关系) 04/17 01:47
6F:→ gsuper:这样就有一个 3*5 的 table 04/17 01:47
7F:→ gsuper:所以5个columns要常态,3个rows也要常态 04/17 01:48
8F:→ gsuper:as.vector(data)来一起看 , 也要常态 (打散) 04/17 01:49
9F:→ gsuper:B大您po的文章我看不懂,没法跟您讨论 0rz 04/17 01:51
10F:→ gsuper:因为每条向量都要计算 sum of squares 04/17 01:53
11F:→ gsuper:而 F 是要计算 SS 的累积量 04/17 01:53
12F:→ gsuper:每一个SS都是依赖常态分布的假设,所以若天生就有一些向量 04/17 01:55
13F:→ gsuper:不符合常态,就会有"多余的SS"跑出来,这时就会影响整体计算 04/17 01:56
14F:→ gsuper:blocks 的例子举的很烂,改成 "高薪","中薪","低薪" 04/17 02:02
15F:→ gsuper:然後 Y 设定成工作效率 (手工作品产量/day) 04/17 02:03
16F:→ bmka:什麽叫"5个columns要常态,3个rows也要常态",不就是 04/17 02:11
17F:→ bmka:每一个subgroup都要normal吗? 04/17 02:12
18F:→ bmka:又"全部打散一起看仍然要常态"指得是什麽? 04/17 02:13
19F:→ gsuper:就是把所有的 Yij , 全部合成一个总向量 04/17 02:15
20F:→ bmka:我的comment跟SS的计算无关,主要是针对常态检定的说法 04/17 02:15
21F:→ bmka:所以我没弄错啊, 全部合起来一起看是mixture of normals 04/17 02:16
22F:→ bmka:而不是normal 04/17 02:16
23F:→ bmka:你的说法是错误的 04/17 02:17
24F:推 gsuper:那 "每一个subgroup都要normal" 这样的假设也是错误的吗? 04/17 02:19
25F:→ bmka:举个例,如果有100男生跟100女生,身高分布各是N(170,10)跟 04/17 02:20
26F:→ bmka:N(155,10),那麽这两笔资料合起来看还是像normal吗 04/17 02:21
27F:→ bmka:normal的假设是每一个subgroup都要成立,也就是Y|(X1,X2) 04/17 02:22
28F:→ bmka:必须是normally distributed 04/17 02:22
29F:推 gsuper:恩 我刚刚想通了,控制组和实验组各自都要常态,但无须总和 04/17 02:22
30F:→ gsuper:是常态 04/17 02:23
31F:→ bmka:You got it. 04/17 02:23
32F:→ gsuper:B大果然是强! 04/17 02:24
33F:→ bmka:拍拍...我小时候也犯过同样的错误 04/17 02:30
34F:推 gsuper:我刚刚想到一个问题,如果是类似 cross-sectional study 04/17 02:39
35F:→ gsuper:那 Yij 不就也是常态分布吗? 04/17 02:40
36F:→ gsuper:因为我以前学的生统 , 是 non-fixed two way ANOVA 04/17 02:40
37F:→ gsuper:这样我原本的推论好像只是针对特定 type 04/17 02:41
38F:→ gsuper:莫非这就是 ANOVA 的参数中 , 选择 typeI~typeIII 的意义? 04/17 02:42
39F:→ bmka:normality assumption 都是放在 conditional distribution 04/17 02:51
40F:→ bmka:of Y given X, 而不是marginal distribution of Y 04/17 02:51
41F:→ bmka:当然,有些情况下X,Y跟Y|X都可能是normal 04/17 02:53
42F:→ bmka:但是在ANOVA, X是binary or categorical,所以啦.... 04/17 02:54
43F:→ bmka:只限制在ANOVA下讨论,Y就不太可能是nomral,除非Y, X独立 04/17 02:58
44F:推 gsuper:若一开始 5组treat 都各取100人 , 或3组treat各取100人 04/17 03:01
45F:→ gsuper:或一开始直接随机取 1000 人在分配到 3*5 的组别内 04/17 03:02
46F:→ gsuper:ANOVA 的 normal assumption 跟这个无关? 04/17 03:03
47F:→ gsuper:更正 , 是三组 blocks 04/17 03:03
48F:→ bmka:为什麽你会觉得有关? 04/17 03:04
49F:推 gsuper:因为计算 sum of squares 可利用的条件随实验设计而不同 04/17 03:06
50F:→ gsuper:即便是最差 , 都还有其中一种边际机率可以用 04/17 03:07
51F:→ gsuper:最好的当然是取 1000 人再分配到 3*5 = 15 cells 内 04/17 03:07
52F:→ gsuper:就跟计算 OR 和 RR 的感觉一样 04/17 03:08
53F:→ bmka:完全看不懂...study design是一回事,model assumption是另一 04/17 03:11
54F:推 gsuper:我多读些书再跟您请教好了 现在想法满混乱的 04/17 03:13
55F:推 obarisk:可以问独立样本t检定是否也是只要两个组都常态吗? 04/17 07:19
56F:→ obarisk:(mean1-mean2)/sp*sqrt(1/n1+1/n2) 04/17 07:21
※ 编辑: bmka 来自: 74.96.30.178 (04/17 10:18)
57F:→ clickhere:typeI~typeIII应该是指SSerror的算法,order is matter. 04/17 11:10
58F:→ bmka:再重新读了一下g大的原文,如果你指的是检定residual的分布 04/17 11:42
59F:→ bmka:还是Y的分布?如果是前者,请看前一篇文章y大的回文 04/17 11:43
60F:推 obarisk:我指资料 04/17 15:18
61F:推 gsuper:SStotal 的想法错了 , 後面对残差的想法也跟着错了 04/17 19:01
62F:→ gsuper:y大的推文我再参详参详 04/17 19:02