作者catherinejoy (whatcanisay)
看板Statistics
标题Re: [问题] 多变量分析中的 群集分析的问题 SPSS …
时间Wed Sep 12 10:59:20 2007
first of all, 请先分清楚 clustering 和classification
中文翻成 前者"分群" 後者"分类"
前者无正确答案 後者有
在cs领域 前者为unsupervised learning 後者为 supervised learning
您提到的 h. clustering 和 k-mean 都是属於前者 (还有一些方法如som knn等)
再则 比较怪异的是 您提到 k-mean 的'分类错误'....@@>
本人想针对您所提工的资讯 点出两件事
1. PCA 把许多x转成 两个 P. componet 是没有单位意义的(用eigan vector
做线性转换),然而许多x对这两个新的线性组合变数的贡献不一,建议在pca
前先对这些x做标准化转换(相当於是用corr matrix 取代 covariance matrix)
2.clustering 的好坏 可以 用'组内差异最小'和'组间差异最大'去评估
下台一鞠躬 ^^
※ 引述《alan74520 (白星星)》之铭言:
: 各位大大你好,我使用的是SPSS,有个问题想要请问大家
: 我有一群变数,我利用PCA将变数缩减至两个,然後我现在想利用群集分析的方法,将原来的样本进行分类,可是都无法分类完全,也就是说总是会有几个分类错误。我该如何改进这样的分类呢
: 我之前是使用Hierarchical Clustering 我知道这样可以分的很细部
: 可是我现在想尝试使用K-means,并自己决定分类的group 可是就是会有分类错误的产生。
: 该如何改进呢?
: 还是说 使用K-means本来就会有误差?
: Ps.我的变数没有先进行标准化,但是单位都相同。
--
※ 发信站: 批踢踢实业坊(ptt.cc)
◆ From: 140.109.23.18