楼主: bojanliu
3877 5

[学习资料] 聚类分析时遇到的难题 [推广有奖]

  • 0关注
  • 0粉丝

大专生

40%

还不是VIP/贵宾

-

威望
0 级
论坛币
862 个
通用积分
0
学术水平
0 点
热心指数
1 点
信用等级
1 点
经验
417 点
帖子
37
精华
0
在线时间
48 小时
注册时间
2011-9-13
最后登录
2014-3-27

楼主
bojanliu 发表于 2012-9-11 16:59:06 |AI写论文

+2 论坛币
k人 参与回答

经管之家送您一份

应届毕业生专属福利!

求职就业群
赵安豆老师微信:zhaoandou666

经管之家联合CDA

送您一个全额奖学金名额~ !

感谢您参与论坛问题回答

经管之家送您两个论坛币!

+2 论坛币
请教一下,现在对假如1万个样本进行聚类,问题是这些样本非常不符合正态分布,大约有1%-2%的样本变量值非常高,而50%左右样本变量值非常低,这样做出来的聚类结果是:1万个样本里最多只有1000个样本被分开成几类,剩下的9千个左右样本始终被归在一类里了。
即那些极值对聚类结果影响很大,我用的是k-means方法,就算预先设定的类再多,比如30个,最后的结果也只是把那些极值一个个分开了,依然有8-9千的样本聚在一起。

我的意思是是否该去掉那些极值,有什么原则来去除?
二维码

扫码加我 拉你入群

请注明:姓名-公司-职位

以便审核进群资格,未注明则拒绝

关键词:聚类分析 k-means means mean 正态分布 正态分布 样本 影响 左右

沙发
keensword 发表于 2012-9-11 17:01:49
我用分层聚类往往遇上这个事。。Kmeans还好。。
如果真是极致的问题,可以考虑挖掉极值。但是从kmeans算法来看,似乎不会这样?

藤椅
bojanliu 发表于 2012-9-11 17:13:49
keensword 发表于 2012-9-11 17:01
我用分层聚类往往遇上这个事。。Kmeans还好。。
如果真是极致的问题,可以考虑挖掉极值。但是从kmeans算法 ...
为啥不会遇到呢? 这1万个样本的值差异太大了:接近98%的样本某个变量值在15以内,而有50-60%左右样本值在0-1之间,有2%左右值在20-300之间。
所以无论我怎么扩大类的数目,大部分样本还是没有被分开。

板凳
bojanliu 发表于 2012-9-11 17:14:52
keensword 发表于 2012-9-11 17:01
我用分层聚类往往遇上这个事。。Kmeans还好。。
如果真是极致的问题,可以考虑挖掉极值。但是从kmeans算法 ...
现在就是想去掉极值,所以想问下有没有什么规则是定义极值方面的。按规则去掉

报纸
bojanliu 发表于 2012-9-11 18:09:33

地板
keensword 发表于 2012-9-12 08:50:10
bojanliu 发表于 2012-9-11 17:14
现在就是想去掉极值,所以想问下有没有什么规则是定义极值方面的。按规则去掉
你把聚类结束样本较少的类去掉呗

您需要登录后才可以回帖 登录 | 我要注册

本版微信群
加好友,备注cda
拉您进交流群
GMT+8, 2026-9-30 06:56