作者Nikonian (Nikonian)
站内Statistics
标题[问题] 简单数据分群
时间Tue Mar 9 17:18:23 2010
是这样的,我家在设计一项产品,而这像产品的尺寸是跟身高有关的
目前想分成五个尺寸,从100cm到200cm,然而虽然身高是接近常态分布
感觉好像就每20公分的身高作一个尺寸就好
但是问题是这样分尺寸的话,就会有不少人会很难挑到合适的尺寸
例如身高160cm的人,刚好卡在140-160和160-180之间
所以如果有大概一千笔身高资料的情况下
有没有什麽比较好的分群方法以及软体能够作这件事情?
因为如果把小孩的状况考虑进去,就会变成其实在120-140cm那段成长很快
所以在资料里面并不是真的常态,而是接近双峰的分布
所以希望可以透过真正的身高资料去作分群
最好做完分群之後,每一组都有显着差异,然後可以求得平均值
不知道我的描述大家理解吗?好像是不太难的任务
但是我不太懂统计,就很难,所以要请各位帮忙了
--
※ 发信站: 批踢踢实业坊(ptt.cc)
◆ From: 58.115.16.69
1F:→ gsuper:用R软体 , kmeans() 函式 , k=5 03/09 17:25
2F:→ gsuper:google 关键字 "supervised" "cluster" "classification" 03/09 17:27
3F:→ Nikonian:Thanks! 我试试看! 03/09 18:37
4F:推 andrew43:很有趣的问题! 03/09 23:29
5F:→ yhliu:要避免跨组的困惑, 切割点可取 "不可能出现" 的数字. 03/10 01:18
6F:→ yhliu:然而, 若就 "实际问题" 而言, 那只是自欺欺人罢了! 03/10 01:19
7F:→ yhliu:如所举身高, 若分割点是 160.1 或 160.5 而量测值只取到整数 03/10 01:20
8F:→ yhliu:固可免除 160 该适用哪一组的问题. 然而, 160身高套用140.5- 03/10 01:21
9F:→ yhliu:160.5的成品, 与套用140-160成品, 有真正差别吗? 03/10 01:22
10F:→ yhliu:或许更应考虑的, 是组距是否会太大, 使得落入同一组者仅有少 03/10 01:27
11F:→ yhliu:数数值(身高)接近组中点者真正能适用该组规格之产品. 03/10 01:28