看板Statistics
标 题Re: [问题] 统计资料寻求组数的方法?
发信站无名小站 (Fri Nov 16 09:51:43 2007)
转信站ptt!Group.NCTU!grouppost!Group.NCTU!wretch
※ 引述《yhliu (老怪物)》之铭言:
> ※ 引述《[email protected] (轩玥)》之铭言:
> > 假设N表示资料的数目,K为组数。
> > 1.K=√N。
> > 2.K=1+3.322xlog(N)。
> > 3.经验法则,决定K。
> > 请问,除了这三种方法之外,还有其它的公式或方法吗?
> > 如果有人知道可以参考的书籍书名,可以麻烦提供一下吗?
> > 谢谢~~
> 就个人观点, 根本无需理会那些公式!
> 倒不如去思考分成几组大概可看出分布的模样.
关於公式:
组数 = 1+log(n)/log(2) = 1+3.22log(n),
经查证, 称为 Sturges' rule, 是 Sturges (1926) 发表
於 JASA, V.21, pp.65-66.
Sturges 是立基於对称二项分布近似常态分布, 而取每一
组次数 C(k-1,j), j=0,1,...,k-1.
但为甚麽要取 C(k-1,j) 为组次数, 而不是 m*C(k-1,j)?
因为 C(k-1,j) 与对称二项分布机率成比例, 而乘一个常
数 m 仍然一样. 结果变成
组数 = 1+log(n/m)/log(2) = 1+3.22log(n/m).
除了 Sturges' rule, 最受广泛注意的大概是 Scott(1979)
发表於 Biometrika, V.66, pp.605–610 的公式
组距(h)=3.5s/n^{1/3}, s = standard deviation
是要使 AMISE 最小的组距. 这也是在常态分布下导出的;
但它仍然有弱点被批评 (例如 Wand (1997), AMS, V.51,
pp.59-64.)
Freedman and Diaconis (1981) 提出 h=2(IQR)/n^{1/3},
以四分位距取代标准差. 若资料近常态, 这组距比 Scott
的小, 大约是80%. 不过似乎较少被提到?
以上资料主要参考
Hyndman1, Rob J. (1995)
The problem with Sturges' rule for constructing histograms.
http://www-personal.buseco.monash.edu.au/~hyndman/papers/sturges.pdf
虽然花更多时间的是杂乱未记录整理而无法在此提及的搜
寻结果.
--
H E L P !!! 统 计 专 业 版 需 要 你 !!! 来 贴 文 吧 !!!
无名小站 telnet://wretch.twbbs.org Statistics (统计方法讨论区)
成大计中站 telnet://bbs.ncku.edu.tw Statistics (统计方法及学理讨论区)
盈月与繁星 telnet://ms.twbbs.org Statistics (统计:让数字说话)
交大资讯次世代 telnet://bs2.twbbs.org Statistics (统计与机率)
★本文未经本人同意请勿转载; 回覆请勿全文引用, 请仅留下直接涉及部分。
--
夫兵者不祥之器物或恶之故有道者不处君子居则贵左用兵则贵右兵者不祥之器非君子
之器不得已而用之恬淡为上胜而不美而美之者是乐杀人夫乐杀人者则不可得志於天下
矣吉事尚左凶事尚右偏将军居左上将军居右言以丧礼处之杀人之众以哀悲泣之战胜以
丧礼处之道常无名朴虽小天下莫能臣侯王若能守之万物将自宾天地相合以降甘露民莫
之令而自均始制有名名亦既有夫亦将知止知止可以不殆譬道之在天 163.15.188.87海