请选择 进入手机版 | 继续访问电脑版
楼主: semenljw
18559 36

[学习分享] SAS中的聚类分析方法总结(1)——聚类分析概述(续2) [推广有奖]

教授

9%

还不是VIP/贵宾

-

威望
0
论坛币
14350 个
通用积分
50.0395
学术水平
56 点
热心指数
62 点
信用等级
46 点
经验
4923 点
帖子
505
精华
2
在线时间
1346 小时
注册时间
2008-12-12
最后登录
2024-3-1

semenljw 在职认证  发表于 2014-5-9 16:09:48 |显示全部楼层 |坛友微信交流群
相似文件 换一批

+2 论坛币
k人 参与回答

经管之家送您一份

应届毕业生专属福利!

求职就业群
赵安豆老师微信:zhaoandou666

经管之家联合CDA

送您一个全额奖学金名额~ !

感谢您参与论坛问题回答

经管之家送您两个论坛币!

+2 论坛币
SAS中的聚类分析方法总结(1)——聚类分析概述

SAS中的聚类分析方法总结(1)——聚类分析概述(续1)


10.     标准化对聚类分析到底有什么影响?


1)    在讲影响之前先罗列一下proc stdize里面的标准化方法吧 1.png


2)    标准化对聚类分析的影响


       从图1中不太容易看清楚标准化对于聚类分析的影响


      2.png


   从图2可以清晰的看到标准化对于聚类分析的影响 3.png


3)     各种标准化方法的比较

一个模拟数据的例子,模拟数据有三个类别,每个类别有100个样本。我们比较了各种标准化方法之后再进行聚类的误判情况,可以大概看出各种标准化方法的差异。但此例并不能说明以下方法中误分类数小的方法就一定优与误分类数大的方法。有时候还跟数据本身的分布特征有关。这个例子也提醒我们有时候我们常用的std和range标准化并不见得是最好的选择。
4.png

附:本节相关sas代码就作为回帖吧。

二维码

扫码加我 拉你入群

请注明:姓名-公司-职位

以便审核进群资格,未注明则拒绝

关键词:聚类分析 分析方法 分析概述 sas代码 range 样本 影响

semenljw 在职认证  发表于 2014-5-9 16:15:42 |显示全部楼层 |坛友微信交流群
/*********************************************************/
/*1.模拟数据1;测试标准化方法对聚类的影响
    模拟数据,样本量相同,均值和方差不相同*/
/*********************************************************/
data compact;
      keep x y c;
      n=100;
     scale=1; mx=0; my=0; c=1;link generate;
     scale=2; mx=8; my=0; c=2;link generate;
     scale=3; mx=4; my=8; c=3;link generate;
      stop;
     generate:
      do i=1 to n;
         x=rannor(1)*scale+mx;
         y=rannor(1)*scale+my;
         output;
      end;
      return;
run;
title '模拟数据1';
proc gplot data=compact;
      plot y*x=c;
      symbol1 c=blue;
      symbol2 c=black;
      symbol3 c=red;
run;

proc stdize data=compact method=std
out=scompacted2;
var x y;
run;
title '标准化后的模拟数据1';
proc gplot data=scompacted2;
plot y*x=c;
     symbol1 c=blue;
     symbol2 c=black;
     symbol3 c=red;
run;

/*********************************************************/
/*2.create result table*/
/*********************************************************/
data result;
length method$ 12;
length misclassified 8;
length chisq 8;
stop;
run;

%let inputs=x y;
%let group=c;
%macro standardize(dsn=,nc=,method=);
title "&method";
%if %bquote(%upcase(&method))=NONE %then %do;
data temp;
set &dsn;
run;
%end;
%else %do;
proc stdize data=&dsn method=&method out=temp;
var &inputs;
run;
%end;
proc fastclus data=temp maxclusters=&nc least=2
out=clusout noprint;
var &inputs;
run;
proc freq data=clusout;
tables &group*cluster / norow nocol nopercent
chisq out=freqout;
output out=stats chisq;
run;
data temp sum;
set freqout end=eof;
by &group;
retain members mode c;
if first.&group then do;
members=0; mode=0;
end;
members=members+count;
if cluster NE . then do;
if count > mode then do;
mode=count;
c=cluster;
end;
end;
if last.&group then do;
cum+(members-mode);
output temp;
end;
if eof then output sum;
run;
proc print data=temp noobs;
var &group c members mode cum;
run;
data result;
merge sum (keep=cum) stats;
if 0 then modify result;
method = "&method";
misclassified = cum;
chisq = _pchi_;
pchisq = p_pchi;
output result;
run;
%mend standardize;

%standardize(dsn=compact,nc=3,method=ABW(.5));
%standardize(dsn=compact,nc=3,method=AGK(.9));
%standardize(dsn=compact,nc=3,method=AHUBER(.5));
%standardize(dsn=compact,nc=3,method=AWAVE(.25));
%standardize(dsn=compact,nc=3,method=EUCLEN);
%standardize(dsn=compact,nc=3,method=IQR);
%standardize(dsn=compact,nc=3,method=L(1));
%standardize(dsn=compact,nc=3,method=L(2));
%standardize(dsn=compact,nc=3,method=MAD);
%standardize(dsn=compact,nc=3,method=MAXABS);
%standardize(dsn=compact,nc=3,method=MEAN);
%standardize(dsn=compact,nc=3,method=MEDIAN);
%standardize(dsn=compact,nc=3,method=MIDRANGE);
%standardize(dsn=compact,nc=3,method=NONE);
%standardize(dsn=compact,nc=3,method=RANGE);
%standardize(dsn=compact,nc=3,method=SPACING(.3));
%standardize(dsn=compact,nc=3,method=STD);
%standardize(dsn=compact,nc=3,method=SUM);
%standardize(dsn=compact,nc=3,method=USTD);

proc sort data=result;
by misclassified;
run;
title '汇总数据';
title2 '聚类判定类别错误样本数排序';
proc print data=result;
run;

使用道具

goldbaodi 发表于 2014-5-12 09:58:01 |显示全部楼层 |坛友微信交流群
very good

使用道具

赞 分享~~~

使用道具

阮思夏 学生认证  发表于 2014-5-20 01:19:57 |显示全部楼层 |坛友微信交流群
赞 分享~~~

使用道具

andy9 发表于 2014-5-21 16:51:23 |显示全部楼层 |坛友微信交流群
谢楼主啊!
非常感谢,学习了!
我有话说,可是我不说!

使用道具

tony2040044 发表于 2014-5-27 17:05:33 |显示全部楼层 |坛友微信交流群
lz 请问下kmeans 聚类出来 怎么画成散点图 用颜色区分不同的组

感谢!!

使用道具

joyyang_joy 发表于 2014-5-28 07:02:09 |显示全部楼层 |坛友微信交流群
谢谢!

使用道具

zorro999 发表于 2014-6-11 15:08:40 |显示全部楼层 |坛友微信交流群
Mark! Thanks for sharing

使用道具

lily841010 发表于 2014-6-15 16:33:16 |显示全部楼层 |坛友微信交流群
谢谢!

使用道具

您需要登录后才可以回帖 登录 | 我要注册

本版微信群
加好友,备注cda
拉您进交流群

京ICP备16021002-2号 京B2-20170662号 京公网安备 11010802022788号 论坛法律顾问:王进律师 知识产权保护声明   免责及隐私声明

GMT+8, 2024-3-29 12:57