作者adu (^_^)
看板Statistics
标题Re: [问题] 将不同的scale标准化的方法?
时间Mon Mar 29 14:41:02 2010
几个问题想请教大家
如果资料点有不同的特徵值
eq: x1 (a1, b1, c1) 、 x2 (a2, b2, c3) 、 x3 (a3, b3, c3) ...
直接做clustering可能会因特徵值的scale不同,使得有些特徵被忽视
eq: 利用SPSS demo了以下十点
点 X Y
1 100.00 10.00
2 100.00 10.00
3 100.00 10.00
4 100.00 1.00
5 100.00 1.00
6 100.00 1.00
7 200.00 1.00
8 200.00 1.00
9 200.00 1.00
10 500.00 1.00
使用K-means分成3群
会由欧基里德距离分成(1,2,3,4,5,6)(7,8,9)(10)
如果为了避免scale造成的影响,使用hierachy分群
先经过Z-Score的处理,可分成(1,2,3)(4,5,6,7,8,9)(10)
後者是我比较想要的结果
想请问大家,我的资料型态有10个轴,彼此并无相关联
共100000点的资料,想经由clustering分成15群,并得到每个分群的boundaries
就刘老师提醒的Mahalanobis distance,跟Z-score相比增加了各变数间的相关性
以我的资料类型用Z-score还是Mahalanobis distance比较适合?
亦想请问SPSS中有选择分群数的Z-score(or Mahalanobis)分群功能吗?
目前看到K-means中没有Z-score可以选,hierachy没有群数的选择
因为我没学过SAS
如果SPSS没有内建,需要用perl写写看
--
※ 发信站: 批踢踢实业坊(ptt.cc)
◆ From: 140.114.88.228