一、数据挖掘定义
从现有的大量数据中,撷取不明显、之前未知、可能有用的知识。
William Frawley & Gregory Piatetsky Shapiro, 1991
数据挖掘目的:建立起决策模型,根据过去的行动来预测未来的行为
二、数据挖掘流程(CRISP-DM)
数据挖掘不是无规律可循的,在进行数据挖掘勘探工作中,我们一般遵循CRISP-DM流程。包含商业理解-数据理解-数据前处理-数据建模-模型评估-模型发布六个步骤。整个流程围绕数据为核心,其中商业理解是产生商业价值的关键步骤,数据前处理是耗时最多的步骤,建模是关键步骤。
当然,数据挖掘的流程不是至上而下的,而是循环往复的过程,比如模型评估的结果差的情况下我们可能需要返回商业和数据理解部分。
三、主流数据挖掘工具
目前主流的数据挖掘工具分开源免费和收费两大类,其中收费软件以SAS EM和IBM SPSS Modeler、Microsoft Sql Server为代表,具有权威易用、解决方案成熟等特点。开源类软件多需要编程实现,比如Python、R。具有灵活多元、可扩展性强等特点。
四、案例展示:医疗业之临床路径预测
1.商业理解
某医院搜集了200个患有同种类型疾病病人的资料。虽然得到的是同种疾病,但是不同的病人、不同的状况,需要采取不同的用药和治疗方式。我们想透过数据挖掘的方法了解到对于不同特征(血压、胆固醇、钠钾含量)的病人给予哪种药物很适合治疗康复。
2.数据理解
DRUG1N.CSV文件,一共包含7个变量,200个观测值。目标属性为用药类型。同时选取了可能有用的解释字段,包含年龄、性别、血压、胆固醇、钠含量、钾含量。
3.数据建模
①数据探索
-了解各变量对目标变量的影响,类别型变量使用条形分布图,数值型变量使用直方图。
例如通过上图我们可以看出血压在影响用药上的分布,血压高中低都会有DrugY用药,而DrugA和DrugB只会在高血压的时候出现,DrugX只会在低血压和正常的时候出现,DrugC只出现在低血压,说明血压对用药的影响在目标字段上比较明显。
通过对年龄字段的探索,我们发现DrugY和DrugX、DrugC在各个年龄段都有分布,而DrugA只出现在大概50岁以下,DrugB只出现在年龄在50岁以上。
② 决策树建模
在这里,我们使用决策树建模的方法,决策树是一种非常常用的分类预测的方法。在IBM SPSS Modeler中我们只需要调用Modelering-C5.0进行建模。
可以看出,这是一个五层的决策树,通过决策树模型运行结果,我们即可对后续的样本进行预测。
4.模型评估
接入Analysis分析节点,运行之后可以发现模型准确率为96.5%。当然,这个是使用原数据集进行建模,实际建模过程中我们还需要用到训练集和测试集拆分的方法来进行建模和评估。
以上只是对数据挖掘的简单介绍,想了解更多的知识?
CDA LEVEL II-建模分析师 SPSS Modeler数据挖掘实战培训,大牛李御玺导师主讲,带你用最通俗的案例体会数据挖掘的魅力~
一、课程安排
北京&远程:2018年3.09~11,,16-18日(六天)
课程费用:现场班5900元,远程班4400元
授课安排:
(1) 授课方式:面授直播两种形式,中文多媒体互动式授课方式
(2) 授课时间:上午9:00-12:00,下午13:30-16:30,16:30-17:00(答疑)
(3) 学习期限:现场与视频结合,长期学习加练习答疑。
二、讲师介绍
李御玺
台湾铭传大学教授/中华数据挖掘协会理事
台湾大学博士,在其相关研究领域已发表超过260篇以上的研究论文,同时也是国科会与教育部多个相关研究计划的主持人。 其还兼任厦门大学数据挖掘中心顾问,中国人民大学数据挖掘中心顾问,IBM SPSS-China顾问。服务过的客户包括:中国工商局、中信银行、台新银行等。
三、优惠信息
1. 全日制学生及CDA LEVEL Ⅰ老学员8折优惠;
2. 三人及以上报名9折优惠,五人及以上8折优惠;
3. CDA LEVEL Ⅰ等级资格证书持有者立省1000元;
4. 同时报名参加LEVELⅠ和LEVEL Ⅱ享受8折优惠。
四、报名流程
1. 在线填写报名信息(扫码访问)
官网端:
微信端:
2. 给予反馈,确认报名信息
3. 网上缴费
4. 开课前一周发送电子版课件和教室路线图
五、学员对象
1.从事数据分析相关工作,希望提升数据挖掘实战能力的企业数据分析人员。
2.从事咨询、科研等与数据挖掘应用领域相关工作的专业人士。
3.从事数据挖掘和统计分析等相关领域教学的高校教师。
4.有志于从事商业数据挖掘分析工作的学生。
5.有志1于学习数据挖掘技术和软件的社会各界人士。
六、联系我们
电话:010-68411404
手机&微信:18010006628
—— Join Learn!
课程试听:https://www.cda.cn/kecheng/34.html
附:SPSS Modeler15.0免费下载链接:
下载链接:http://pan.baidu.com/s/1nvI8rbj 密码:8h24