Advertisement

数据挖掘的流程

阅读量:

Data Mining Environment refers to a comprehensive process that involves extracting unknown yet valuable information from within large-scale databases. This process not only assists in decision-making processes or enhances knowledge but also provides practical insights that can be applied in various fields. A Data Mining Environment can be illustrated as follows:

7.2数据挖掘过程图
下图描述了数据挖掘的基本过程和主要步骤

数据挖掘的基本过程和主要步骤

7.3 数据挖掘过程工作量
在数据 mining 的过程中被关注的对象是整个流程的基础,它推动了整个 data mining 流程,同时也是验证最终成果并指导分析人员完成 data mining 的关键依据。图 2 中列出的各个阶段是按照特定顺序依次进行的,当然在整个过程中还存在着各阶段之间的相互反馈关系。显然,在大多数情况下,并没有完全自动化的过程,大部分工作仍需人工干预。图 3 详细展示了各个阶段在整个流程中的工作量比例。结果显示,约有 60%的时间用于数据准备阶段,这凸显了 data mining 对高质量数据的需求;而后进行的数据建模工作仅占总工作量的大约 10%。

图3数据挖掘过程工作量比例

7.4数据挖掘过程简介
过程中各步骤的大体内容如下:
1.1. 确定业务对象
清晰地定义出业务问题,认清数据挖掘的目的是数据挖掘的重要一步.挖掘的最后结构是不可预测的,但要探索的问题应是有预见的,为了数据挖掘而数据挖掘则带有盲目性,是不会成功的.
2.2. 数据准备
1)1) 数据的选择
搜索所有与业务对象有关的内部和外部数据信息,并从中选择出适用于数据挖掘应用的数据.
2)2) 数据的预处理
研究数据的质量,为进一步的分析作准备.并确定将要进行的挖掘操作的类型.
3)3) 数据的转换
将数据转换成一个分析模型.这个分析模型是针对挖掘算法建立的.建立一个真正适合挖掘算法的分析模型是数据挖掘成功的关键.
3.3. 数据挖掘
对所得到的经过转换的数据进行挖掘.除了完善从选择合适的挖掘算法外,其余一切工作都能自动地完成.
4.4. 结果分析
解释并评估结果.其使用的分析方法一般应作数据挖掘操作而定,通常会用到可视化技术.
5.5. 知识的同化
将分析所得到的知识集成到业务信息系统的组织结构中去.
7.5数据挖掘需要的人员
数据挖掘过程的分步实现,不同的步会需要是有不同专长的人员,他们大体可以分为三类.
业务分析人员:要求精通业务,能够解释业务对象,并根据各业务对象确定出用于数据定义和挖掘算法的业务需求.
数据分析人员:精通数据分析技术,并对统计学有较熟练的掌握,有能力把业务需求转化为数据挖掘的各步操作,并为每步操作选择合适的技术.
数据管理人员:精通数据管理技术,并从数据库或数据仓库中收集数据.
从上可见,数据挖掘是一个多种专家合作的过程,也是一个在资金上和技术上高投入的过程.这一过程要反复进行牞在反复过程中,不断地趋近事物的本质,不断地优先问题的解决方案。数据重组和细分添加和拆分记录 选取数据样本可视化数据探索聚类分析神经网络、决策树数理统计、时间序列结论综合解释评价数据知识数据取样数据探索数据调整模型化评价。

全部评论 (0)

还没有任何评论哟~