数据分析心得——聚类分析时的极端值处理
在对农户问卷数据做聚类分析时,先考察数据的分布,一般情况下很多变量均是正偏态分布,在不想去除极端值的情况下(去除极端值会造成本不多的样本再度流失)可考虑在系统聚类时用横向标准化的方法并用中位数进行聚类。这样既不损失样本,又能在不受极端值影响下考察数据的集中趋势,不至于得到不好甚至错误的分析结果(因为均值受极端值影响)。
PS:若连续变量不存在大量的0的情况下,可考虑对原始数据进行对数变换解决其正偏态分布的问题,如有大量0存在时,就不能取对数了,因为ln(0)无意义。


雷达卡






京公网安备 11010802022788号







