楼主: densonli
6516 2

[问题] [傻问题]K-Means和EM聚类后,如何确定类别的边界? [推广有奖]

  • 0关注
  • 0粉丝

小学生

92%

还不是VIP/贵宾

-

威望
0 级
论坛币
8 个
通用积分
0
学术水平
0 点
热心指数
0 点
信用等级
0 点
经验
99 点
帖子
5
精华
0
在线时间
12 小时
注册时间
2012-11-13
最后登录
2013-9-9

楼主
densonli 在职认证  发表于 2013-1-8 14:28:59 |AI写论文

+2 论坛币
k人 参与回答

经管之家送您一份

应届毕业生专属福利!

求职就业群
赵安豆老师微信:zhaoandou666

经管之家联合CDA

送您一个全额奖学金名额~ !

感谢您参与论坛问题回答

经管之家送您两个论坛币!

+2 论坛币
各位达人请教了,本人刚学习数据挖掘,有很多傻问题没有方向。

最近在做一些简单的数据挖掘,想通过聚类对客户的某些属性进行分类。
在通过KMeans和EM算法后会得到几个分类的中心点,但不知道如何定义这些分类的边界。
比如对用户消费金额做聚类,产生三个中心点如下:
kMeans
======

Number of iterations: 7
Sum of within cluster distances: 248.1496183206104
Missing values globally replaced with mean/mode

Cluster centroids:
                         Cluster#
Attribute     Full Data         0         1         2
                 (5000)    (1128)    (2208)    (1664)
=====================================================
MGCM_PT_KDJ         378    1132.5       210       420


Clustered Instances

0      1129 ( 23%)
1      2267 ( 45%)
2      1604 ( 32%)

但不知道这0类,1类,2类如果要设定一个数值区间的话,应该是从多少到多少。
同样用EM方法对同一数据集做聚类得到如下结果:
EM
==

Number of clusters: 3


               Cluster
Attribute            0        1        2
                (0.41)   (0.27)   (0.33)
=========================================
MGCM_PT_KDJ
  mean         199.1228 384.1965 945.5542
  std. dev.     17.6059  52.5456 258.3787

Clustered Instances

0      2087 ( 42%)
1      1312 ( 26%)
2      1601 ( 32%)


Log likelihood: -6.45408

也不知如何定义这三类的边界应该设为从多少到多少。

救急,谢谢大家先!


二维码

扫码加我 拉你入群

请注明:姓名-公司-职位

以便审核进群资格,未注明则拒绝

关键词:k-means means mean ans Likelihood 聚类

沙发
benben88088 发表于 2014-7-10 10:49:20
同问,有人知道吗,thanks。

藤椅
420948492 发表于 2014-7-11 17:19:26
光有一个均值是不够的,你可以先分析下消费金额在每个类别的分布。另外你的目的是什么,是为了对新样本归类??

您需要登录后才可以回帖 登录 | 我要注册

本版微信群
加好友,备注cda
拉您进交流群
GMT+8, 2026-9-28 23:07