作者yhliu (老怪物)
看板Statistics
标题卡方检定?
时间Sat Jan 13 12:40:48 2007
看到版上一篇旧文, 有人大扯甚麽卡方检定是无母数检定
的理由是源自概度比统计量, 还说 Pearson卡方统计量就
是由概度比检定而来的.
虽然也有所谓 nonparametric likelihood, 但 GLR 统计
量与卡方扯上关系, 根本与无母数不相干! 可以说: 既是
无母数, 你的 likelihood 又是如何来的?
再者, 说 Pearson 卡方来自 likelihood ratio, 不怕老
皮跨越时空来掐死你吗?
(去查一查 K. Pearson 与 R. A. Fisher 的故事吧!)
事实上在类别资料分析及广义线模中, 由概度比统计量得
到的近似卡方统计量 (
-2(log-likelihood-ratio)) 称之
为 G^2, 与 Pearson 卡方只是
"当虚无假说成立时两者渐近相等"
为以上缘故, 把一篇旧文拿来贴:
时间 Thu Jun 15, 2000
※ 引述《yhliu (需要休息的老怪物)》之铭言:
: 至於配合适度检定, 列联表分析, 或其他类别资料 (离
: 散资料) 分析中的卡方检定, 都是因为多项分布当 n 很
: 大时会接近多变量常态分布; 再利用 (2) 而得到 "渐近
: 服从卡方分布" 的结论。
卡方检定的原理, 一方面涉及统计量的分布 --- 大样本
渐近分布 --- 如上述; 另方面涉及 "良好检定" 的理论,
在这里不谈。
除此之外, 卡方检定有甚麽可谈的呢?
以配合适度检定来说, 设观测次数为 n(1),...,n(k),
n=n(1)+...+n(k). 在适当条件下, 这些 n(i) 联合服从
多项分布 Multinomial(n; p(1),...,p(k))。
所以, 理论上第 i 个格子应该有 m(i)=np(i) 这麽多个
观测值; 但我们实际上看到的是 n(i)。
如果样本数 n 是随机决定的, 而且是服从卜瓦松分布,
则 n(1),...,n(k) 变成相互独立的卜瓦松变量 --- 这
是 "类别资料分析" 的书或课程可能提到, 但一般统计
学较少提到的.
因此, 我们可在 n(i)~Poisson(m(i)), 且相互独立,
这个架构下来看配合适度检定的问题.
当 m(i) 很大时, n(i) 接近常态. 也就是说: 标准化後
它的分布会接近 N(0,1)。而由前面对卡方分布的说明,
← 那是另一篇
我们可知 (n(i)-m(i))^2/m(i) 会接近卡方, df=1。
如果 n~Poisson(m), m=m(1)+...+m(k), 其中 m(i) 都
已知, 则卡方统计量
\sum (n(i)-m(i))^2/m(i),
← "\sum" 即是加总.
依前面的讨论来看, 应该是接近 chi-squared, df=k.
但事实上或者 n 固定, 或者 m 要用 n 估计, 所以离差
n(1)-m(1), n(2)-m(2),....,n(k)-m(k), 要满足 "总和
为 0" 的这一个条件。因此, 就像在常态群体之样本变
异数 S^2 一样, 自由度少了 1, 所以, 若p(1),...,p(k)
机率已知 (在 Poisson 模型, p(i)=m(i)/m) 则上述卡
方统计量的自由度是 k-1。
实际的问题, m(i) 可能要用一些参数来界定. 例如 m(i)
可能是由常态分布算出来的, 但常态分布的平均数和标
准差估计, 所以 m(i) 实际上是未知的。
当模型中有一个参数用资料估计时, 离差量
d(1)=n(1)-m(1), d(2)=n(2)-m(2),....,d(k)=n(k)-m(k)
就多了一个限制式。因此这些离差量看成 R^k 中的一个
点, 是在一个低於 k 维的子空间的。如前面只有 m 需
要估计, 或 n 固定时, 离差是在一个 k-1 维子空间上
的。k=3 时, (d(1),d(2),d(3)) 满足
d(1)+d(2)+d(3)=0,
是在一个平面上。若再加一个限制, 例如
d(1)-d(3)=0
则 (d(1),d(2),d(3)) 事实上被限制在一条直线上。
因此, 配合适度检定 (n 固定) 在没有参数需估计时,
是用 df=k-1 的卡方; 但有参数要估计时, df=k-1-p,
其中 p 是估计的参数个数。
前面谈卡方统计量, 是假设 n~Poisson(m); 但在讨论
自由度时, 忽而用 Poisson 模式而说 m 要估计, 忽而
又说 n 固定。这...这究竟哪个是对的?
实况是: 假设 n~Poisson(m) 而 m 要估计, 则 m 的估
计量是 n。结果是: 在做一些统计推论时, 和 n 固定的
效果是相同的 --- 这涉及一些机率和数理统计的东西,
我们就不谈了! 我们就直接接受这个事实: 将 (n(1),...,n(k))
看成是 multinomial(n,p(1),..,p(k)), 与将 n(i) 看
成是相互独立的 Poisson(m(i)), 而用
n=n(1)+...+n(k) 估计 m=m(1)+...+m(k)
则卡方统计量等等, 都是一样的。
因为这个缘故, 前文采用 Poisson 模型解释卡方统计量
的来源; 但若直接用 multinomial 模型, 应用大样本二
次式近似卡方的想法, 也可导出相同的卡方统计量, 只
是较费事罢了!
我们将上述结果用在列联表独立性检定问题, 以结束这
整个主题.
对一个 IxJ 列联表, n(i,j), i=1,...,I, j=1,...,J,
观测总数 n, 细格机率 p(i,j), m(i,j)=n p(i,j). 这
样的架构, 和前述配合适度检定问题, 基本上没有差别!
不同的是问题---也就是 p(i,j) 如何决定的。
在一维分布的配合适度检定, 如先前所谈的, 可能是固
定机率分布, 配合常态分布, 配合卜瓦松分布等等。而
在列联表的问题, 我们所要检定的, 可能是
p(i,j)=p1(i)p2(j)
这样的 "分布" --- 没有指明特定的边际分布, 只有对
这分布的一些条件 --- 事实上, 配合常态, 配合卜瓦松
分布等, 也都可看成和上述所谓 "独立性" 条件一样,
只是在规范 p(i,j) (或先前的 p(i)) 的构造。
上述 p(i,j)=p1(i)p2(j) 中的 p1(i)=\sum_j p(i,j),
← "\sum" 即是加总.
p2(j)=\sum_i p(i,j). 因 p1(i), p2(j) 未指定, 所以
要用资料估计。而 p(i) 对 i 加总为 1; p(j) 对 j 加
总也是, 所以实际上要估计 (I-1)+(J-1) 个未知参数。
於是, 依前文所谈的原理, 卡方统计量的自由度, 或说是
IJ 个离差的自由度, 是
(IJ-1)-[(I-1)+(J-1)] = (I-1)(J-1)
有的列联表是列和或行和固定的, 这情形就像前面对 n
固定或随机而需要估计其参数一样, 结论是: 不影响我
们所要做的统计推论。因此, 用同样的卡方统计量, 同
样的自由度。
--
--
※ 发信站: 批踢踢实业坊(ptt.cc)
◆ From: 163.15.188.87