请教一下,现在对假如1万个样本进行聚类,问题是这些样本非常不符合正态分布,大约有1%-2%的样本变量值非常高,而50%左右样本变量值非常低,这样做出来的聚类结果是:1万个样本里最多只有1000个样本被分开成几类,剩下的9千个左右样本始终被归在一类里了。
即那些极值对聚类结果影响很大,我用的是k-means方法,就算预先设定的类再多,比如30个,最后的结果也只是把那些极值一个个分开了,依然有8-9千的样本聚在一起。
我的意思是是否该去掉那些极值,有什么原则来去除?
|
楼主: bojanliu
|
3877
5
[学习资料] 聚类分析时遇到的难题 |
|
大专生 40%
-
|
| ||
|
|
| ||
加好友,备注cda京ICP备16021002号-2 京B2-20170662号
京公网安备 11010802022788号
论坛法律顾问:王进律师
知识产权保护声明
免责及隐私声明
用户协议


