作者bmka (偶素米蟲)
站內Statistics
標題Re: [問題] ANOVA 有常態分佈的假設嗎?
時間Sun Apr 17 00:10:09 2011
推 gsuper:我記得 2-way ANOVA 的假設 , 需要在 r*k 的 table 中 04/15 14:17
→ gsuper:直的看每條都要常態 , 橫的看也都要常態 , 全部打散一起看 04/15 14:17
→ gsuper:仍然要常態 , 如果太不像常態分部 , 有時候 F會小於1 04/15 14:18
推 gsuper:SStotal(全)=SSblock(橫)+SStreat(直)+SSresidual(殘) 04/15 14:22
→ gsuper:照這邏輯來看,殘差也要是常態分部based on全橫直三項的運算 04/15 14:23
→ huggie:你的意思是全橫直都常態分佈的話,殘差看來就要是常態了? 04/15 16:26
→ gsuper:恩,就是前三項符合常態,殘差自然就是常態 04/15 16:36
上面這段話說得不對
Let X be a binary variable, and assume that
Y given X has a normal distribution.
Then, unconditioning on X, the marginal distribution
of Y is a mixture of two normal distributions.
In other words, when you pool data together and
ignore the information about X, the outcome
variable Y is not normally distributed (unless
X is independent of Y).
Apply the same argument to two way ANOVA:
"Y|(X1,X2)~ Normal" implies neither "Y|X1~ Normal" nor "Y~Normal".
"直的看每條都要常態 , 橫的看也都要常態 , 全部打散一起看仍然要常態"
這句話完全錯誤
--
※ 發信站: 批踢踢實業坊(ptt.cc)
◆ From: 74.96.30.178
※ 編輯: bmka 來自: 74.96.30.178 (04/17 00:16)
1F:→ west1996:你好像誤會了他的意思?? 04/17 00:21
2F:→ bmka:我的中文不好,那麼gsuper指的是?? 04/17 00:26
3F:→ gsuper:我的意思是 , 假設現在有 5 treatments(直) , 工廠一到五 04/17 01:46
4F:→ gsuper:又分成三種 blocks , 工作效率 低,中,高 04/17 01:47
5F:→ gsuper:先假設沒有重複實驗 (有也沒關係) 04/17 01:47
6F:→ gsuper:這樣就有一個 3*5 的 table 04/17 01:47
7F:→ gsuper:所以5個columns要常態,3個rows也要常態 04/17 01:48
8F:→ gsuper:as.vector(data)來一起看 , 也要常態 (打散) 04/17 01:49
9F:→ gsuper:B大您po的文章我看不懂,沒法跟您討論 0rz 04/17 01:51
10F:→ gsuper:因為每條向量都要計算 sum of squares 04/17 01:53
11F:→ gsuper:而 F 是要計算 SS 的累積量 04/17 01:53
12F:→ gsuper:每一個SS都是依賴常態分布的假設,所以若天生就有一些向量 04/17 01:55
13F:→ gsuper:不符合常態,就會有"多餘的SS"跑出來,這時就會影響整體計算 04/17 01:56
14F:→ gsuper:blocks 的例子舉的很爛,改成 "高薪","中薪","低薪" 04/17 02:02
15F:→ gsuper:然後 Y 設定成工作效率 (手工作品產量/day) 04/17 02:03
16F:→ bmka:什麼叫"5個columns要常態,3個rows也要常態",不就是 04/17 02:11
17F:→ bmka:每一個subgroup都要normal嗎? 04/17 02:12
18F:→ bmka:又"全部打散一起看仍然要常態"指得是什麼? 04/17 02:13
19F:→ gsuper:就是把所有的 Yij , 全部合成一個總向量 04/17 02:15
20F:→ bmka:我的comment跟SS的計算無關,主要是針對常態檢定的說法 04/17 02:15
21F:→ bmka:所以我沒弄錯啊, 全部合起來一起看是mixture of normals 04/17 02:16
22F:→ bmka:而不是normal 04/17 02:16
23F:→ bmka:你的說法是錯誤的 04/17 02:17
24F:推 gsuper:那 "每一個subgroup都要normal" 這樣的假設也是錯誤的嗎? 04/17 02:19
25F:→ bmka:舉個例,如果有100男生跟100女生,身高分布各是N(170,10)跟 04/17 02:20
26F:→ bmka:N(155,10),那麼這兩筆資料合起來看還是像normal嗎 04/17 02:21
27F:→ bmka:normal的假設是每一個subgroup都要成立,也就是Y|(X1,X2) 04/17 02:22
28F:→ bmka:必須是normally distributed 04/17 02:22
29F:推 gsuper:恩 我剛剛想通了,控制組和實驗組各自都要常態,但無須總和 04/17 02:22
30F:→ gsuper:是常態 04/17 02:23
31F:→ bmka:You got it. 04/17 02:23
32F:→ gsuper:B大果然是強! 04/17 02:24
33F:→ bmka:拍拍...我小時候也犯過同樣的錯誤 04/17 02:30
34F:推 gsuper:我剛剛想到一個問題,如果是類似 cross-sectional study 04/17 02:39
35F:→ gsuper:那 Yij 不就也是常態分佈嗎? 04/17 02:40
36F:→ gsuper:因為我以前學的生統 , 是 non-fixed two way ANOVA 04/17 02:40
37F:→ gsuper:這樣我原本的推論好像只是針對特定 type 04/17 02:41
38F:→ gsuper:莫非這就是 ANOVA 的參數中 , 選擇 typeI~typeIII 的意義? 04/17 02:42
39F:→ bmka:normality assumption 都是放在 conditional distribution 04/17 02:51
40F:→ bmka:of Y given X, 而不是marginal distribution of Y 04/17 02:51
41F:→ bmka:當然,有些情況下X,Y跟Y|X都可能是normal 04/17 02:53
42F:→ bmka:但是在ANOVA, X是binary or categorical,所以啦.... 04/17 02:54
43F:→ bmka:只限制在ANOVA下討論,Y就不太可能是nomral,除非Y, X獨立 04/17 02:58
44F:推 gsuper:若一開始 5組treat 都各取100人 , 或3組treat各取100人 04/17 03:01
45F:→ gsuper:或一開始直接隨機取 1000 人在分配到 3*5 的組別內 04/17 03:02
46F:→ gsuper:ANOVA 的 normal assumption 跟這個無關? 04/17 03:03
47F:→ gsuper:更正 , 是三組 blocks 04/17 03:03
48F:→ bmka:為什麼你會覺得有關? 04/17 03:04
49F:推 gsuper:因為計算 sum of squares 可利用的條件隨實驗設計而不同 04/17 03:06
50F:→ gsuper:即便是最差 , 都還有其中一種邊際機率可以用 04/17 03:07
51F:→ gsuper:最好的當然是取 1000 人再分配到 3*5 = 15 cells 內 04/17 03:07
52F:→ gsuper:就跟計算 OR 和 RR 的感覺一樣 04/17 03:08
53F:→ bmka:完全看不懂...study design是一回事,model assumption是另一 04/17 03:11
54F:推 gsuper:我多讀些書再跟您請教好了 現在想法滿混亂的 04/17 03:13
55F:推 obarisk:可以問獨立樣本t檢定是否也是只要兩個組都常態嗎? 04/17 07:19
56F:→ obarisk:(mean1-mean2)/sp*sqrt(1/n1+1/n2) 04/17 07:21
※ 編輯: bmka 來自: 74.96.30.178 (04/17 10:18)
57F:→ clickhere:typeI~typeIII應該是指SSerror的算法,order is matter. 04/17 11:10
58F:→ bmka:再重新讀了一下g大的原文,如果你指的是檢定residual的分佈 04/17 11:42
59F:→ bmka:還是Y的分佈?如果是前者,請看前一篇文章y大的回文 04/17 11:43
60F:推 obarisk:我指資料 04/17 15:18
61F:推 gsuper:SStotal 的想法錯了 , 後面對殘差的想法也跟著錯了 04/17 19:01
62F:→ gsuper:y大的推文我再參詳參詳 04/17 19:02