作者taidiy (恬淡虚无真气从之)
看板Statistics
标题[问题] 请问这题的数据应该视为常态吗?
时间Fri Jul 20 22:42:43 2012
如果是跟统计软体有关请重发文章
如果跟论文有关也烦请您重发文章
文章类别是为了帮助大家搜寻资料与解答,造成不便之处请见谅
某研究欲了解饮用水加氟前後学童蛀牙率之改变情形,
选择了16个饮用水加氟的社区作为研究区域,这些社区
饮用水加氟前後,每百名学童没有蛀牙之百分比如下:
编号----加氟前%----加氟後%----D(後-前)%
1. 18.2 49.2 31.0
2. 21.9 30.0 8.1
3. 5.2 16.0 10.8
4. 20.4 47.8 27.4
5. 2.8 3.4 0.6
6. 21.0 16.8 -4.2
7. 11.3 10.7 -0.6
8. 6.1 5.7 -0.4
9. 25.0 23.0 -2.0
10. 13.0 17.0 4.0
11. 76.0 79.0 3.0
12. 59.0 66.0 7.0
13. 25.6 46.8 21.2
14. 50.4 84.9 34.5
15. 41.2 65.2 24.0
16. 21.0 52.0 31.0
---------------------------------------
这个题目是今年高考生物统计学里的题目
乍看之下我直接用paired t test来检定加氟前後是否有显着差异
考完後回想这题越想越奇怪
1.首先D值的分布一看之下不呈常态,照理说应该不能用t test吧??
2.再来是题目描述的取样方法,是一个社区取得一个比例数值
也就是一次取样, n=16, 这样对吗??
3.有同学讨论说可是他每个社区都找了一些学童样本,n肯定是很大
而且又重复16次, 根据中央极限定理, 在重复抽样下, 样本分布会趋近常态,
因此可以视这些数据为常态,这样对吗??
4.平均值=12.21 样本标准差=13.616
5.四分位数 Q1=0.1, Q2=7.55, Q3=25.7, Q4=34.5, 有唯一温和极端值-4.2
因为我始终无法认为题目描述的抽样方法叫做"重复抽样",
实际上也不可能也没有那麽多经费让研究者这样做,
同学一番论点又让我感到很困惑,所以特来请教板上强者为我解惑,感谢:D
--
--
※ 发信站: 批踢踢实业坊(ptt.cc)
◆ From: 111.252.7.110
※ 编辑: taidiy 来自: 111.252.7.110 (07/20 22:56)
1F:→ genteel:1. t-test=/=ND,符合大样本才能依中央极限定理,趋近常态, 07/20 23:21
2F:→ genteel:以样本变方估计母体变方,不需要ND假设. 07/20 23:22
3F:→ genteel:2. 是的,我认为这题应以paired-t解. 07/20 23:23
4F:→ genteel:3. 各社区内有无蛀牙是二项分布问题,我认为社区内分布情 07/20 23:26
5F:→ genteel:形与题旨讨论加氟前後差异无关. 07/20 23:28
6F:→ genteel:样本直接来自这十六个社区加氟前後差异. 07/20 23:30
7F:→ genteel:更正一下第一句, t-distribution 07/21 10:42
8F:→ yhliu:1. "一看之下不呈常态" 是指你有观察茎叶图或常态分布图得到 07/21 20:05
9F:→ yhliu: 的看法吗? 07/21 20:05
10F:→ yhliu:2. 是的, 这是以 "社区" 为抽样单位的一个样本. n=16. 07/21 20:06
11F:→ yhliu:3. 贵同学的看法不正确. 再者, 因各社区大小不同, 认真说起 07/21 20:07
12F:→ yhliu: 来, 这些样本还会有不等幅变异的问题. 07/21 20:08
13F:→ yhliu:5. 四分位数怎会有4个? 4个分位数应把资料分成5部分, 那就不 07/21 20:09
14F:→ yhliu: 是四分位数了. 07/21 20:09
15F:→ yhliu:总结: 如果16个社区是等机率随机选出的, 忽略异幅变异的问题 07/21 20:10
16F:→ yhliu:虽然两次调查结果比例差可能不成常态分布, 但若没有明显偏态 07/21 20:12
17F:→ yhliu:基於 t 检定的 robustness, n=16 或许勉强仍可用 t 检定. 07/21 20:13
18F:→ yhliu:当然, 也可考虑 based on ranks 的非参数方法. 07/21 20:14
19F:→ yhliu:一个最简单, 条件最少的非参数化方法, 就是 sign-test. 07/21 20:15
20F:→ yhliu:试算了一下, sign-test 的单尾 p 值是 0.038. 07/21 20:17
21F:→ taidiy:喔喔 感谢g大和y大, 所以应该是假设样本均值呈t分布,我之前 07/22 22:47
22F:→ taidiy:误以为样本资料要呈常态才能进行t test, 这样我有些懂了^^ 07/22 22:48
23F:→ taidiy:回应y大, 是从手画box plot看出来的, 然後Q4其实是最大值XD 07/22 22:52
24F:→ yhliu:"样本均值呈t分布" 这说法不正确. 是 "原资料为常态群体之 07/25 10:43
25F:→ yhliu:简单随机样本时, t 统计量服从常态分布. 但 t 统计量算是一 07/25 10:44
26F:→ yhliu:个颇稳健的统计量, 因此如果群体分布没有偏离常态太多, t 统 07/25 10:45
27F:→ yhliu:计量的分布, 只要不是样本太小, 仍可用 t 分布当近似." 07/25 10:45
28F:→ yhliu:以上关於 t 分布之适用性, 是参考 Moore 等人的一本初统教本 07/25 10:48
29F:→ yhliu:的 rule of thumb, 可参考 telnet://bs2.twbbs.org 之 07/25 10:49
30F:→ yhliu:Statistics 版 --> 4 --> 10 --> 18, 或 07/25 10:51
31F:→ yhliu:telnet://bbs.ncku.edu.tw 之 Statistics 版(按z进入) 07/25 10:52
32F:→ yhliu: --> 7 --> 9 --> 14. 又可参考同一 ->7 ->11 ->8 ->1 07/25 10:54
33F:→ genteel:我的意思只是要说别把t-dist与ND混为一谈,y大已经用中央 07/25 23:05
34F:→ genteel:极限定理的意义说明了:在符合常态分配的大样本中,如以随机 07/25 23:06
35F:→ genteel:抽样方式抽出其中的样本,这些样本的排列会符合常态. 07/25 23:07
36F:→ genteel:而在较小样本中,t-test即趋近常态的分布特性检定与母体 07/25 23:10
37F:→ genteel:均值的差异程度. 07/25 23:11
38F:→ genteel:常态分布的假设应建立在"所有社区(包含其他社区之母体), 07/25 23:13
39F:→ genteel:加氟前後的差异呈常态分配",而非呈"均值t-dist的假设". 07/25 23:14