薛薇《SPSS Modeler数据挖掘方法及应用-(第2版)》- 买旧书上有路

城市

店铺名称

店主联系方式

店铺售价

库存

店铺得分/总交易量

发布时间

操作

新书比价

网站名称

书名

售价

优惠

操作

图书详情

出版社

电子工业出版社
ISBN

9787121222030
作者

薛薇
页数

268
出版时间

2014年01月01日
定价

¥39.00
所属分类

全部分类 > 计算机与网络 > 数据库

内容提要

数据挖掘是当前数据分析领域中*活跃、*前沿的地带。本书以数据挖掘的实践过程为主线,通过生动的应用案例,从数据挖掘实施角度,系统介绍了经典的数据挖掘方法和利用SPSS Modeler实现数据挖掘的全部过程,讲解方法从易到难,说明问题从浅至深。本书力求以*通俗的方式阐述数据挖掘方法的核心思想与基本原理,同时配合SPSS Modeler软件操作的说明,希望读者能够直观了解方法本质,尽快掌握SPSS Modeler软件使用,并应用到数据挖掘实践中。书中所有数据和案例与华信教育资源网上数据资料内容一致。
SPSS Modeler数据挖掘方法及应用-(第2版)_薛薇_电子工业出版社_

文章节选

前言
数据挖掘是当前数据分析领域中*活跃*前沿的地带。
任何事物都有定性和定量两个方面,定量则产生数据。从数据分析入手是我们认识事物本质的基本手段。任何事物都是互相关联着的,从数据分析入手是我们把握事物之间联系的基本方法。任何事物都在永恒地变化发展着,从数据分析入手是我们探索事物发展规律的基本思路。所以我们进行数据分析,既是一种世界观,也是一种方法论。我们在研究着丰富多彩的客观世界的同时,也体现着分析者主观的智慧和自身的价值。
随着中国社会经济的蓬勃发展,在错综复杂的宏观、中观和微观的共同作用下,战略决策和战术选择都显得敏感而关键,越来越多的人们加入到数据分析的行列中来。这是一个非常富有挑战性的工作,不但有意思而且有意义。
IBM公司于2009年1月公布了其“智慧地球”战略。该战略的主要思想是,将传感设备或智能仪表嵌入到建筑、电力、交通、管道等各种物体中,进行数据自动采集,之后基于互联网形成物物相联的物联网,然后通过**计算机和云计算将数据整合,进行智能化分析和建模,从而实现社会与物理世界的融合。这是一个未来理想化的信息世界图景。
在这个智慧系统中,其核心是数据处理。为此,IBM公司于2009年7月斥资12亿美元收购了**的SPSS 统计分析软件公司,将其应用广泛的SPSS统计分析软件和Clementine数据挖掘软件纳入麾下。同时对软件产品进行了整合,将Clementine更新命名为PASW(Predictive Analytics SoftWare)Modeler,并快速推向市场。
目前,SPSS Clementine软件已经连续若干年蝉联数据挖掘应用的**,而业界对于PASW Modeler的认知则刚刚开始。所以本书继续沿用为广大读者所熟悉的Clementine这个名字。
Clementine软件不但将计算机科学中许多机器学习的**算法带入到数据分析中来,同时也综合了一些行之有效的数据挖掘方法,成为内容*为全面、功能*为强大的数据挖掘产品。
Clementine软件充分利用计算机系统的运算处理能力和图形展现能力,将方法、应用与工具有机地融合为一体,是解决数据挖掘问题的*理想工具。
Clementine软件继续保持了SPSS产品的一贯风格:界面友好且容易使用。复杂的数学算法和冗余的输出结果被软件隐藏在程序系统内部。Clementine软件始终把自己的应用对象锁定在实际部门的业务分析人员,而不是一个数据分析专家。这种“傻瓜型”软件经常遭到一些精英学者的指摘,但是这恰恰成为Clementine成功开拓自己应用疆域的*有效利器。
本书作者常年从事计算机数据分析的教学与科研工作,并长期跟踪研究SPSS公司数据分析产品,具有计算机应用与统计分析的双重学历背景。我们深知,对于数据挖掘这样一款综合方法性的软件工具来说,一个基层的读者应该从哪些方面入手,就能很快地掌握和使用Clementine开始数据挖掘工作,并从中受益。
本书默认读者具有以下特征:具有基础的计算机操作能力;不甚了解数据挖掘的原理和方法;有自己应用领域积累的数据,渴望使用数据挖掘方法解决实际问题。
所以,针对上述读者群,本书的特点是:
1.以数据挖掘过程为线索介绍Clementine软件
目前,具备基本的计算机操作能力已经不是读者的障碍,数据挖掘的过程与方法才是读者关心的主题和应用的难点。各领域众多的读者所面临的问题是:自己拥有的一批数据不知道如何使用Clementine进行组织,不知道如何利用Clementine对它们进行基本加工和整理;其次,不知道选择Clementine中的哪些方法对数据进行分析,不知道如何解释分析结果。
因此,本书以数据挖掘的实践过程为主线,从Clementine数据管理入手,说明问题从浅至深,讲解方法从易到难。这样,能使读者在较短时间内掌握Clementine的基本功能和一般方法,并可快速地运用于实际工作中。
2.数据挖掘方法、软件操作、案例分析的有机结合
目前,由于数据挖掘方法的中文资料相对不足,Clementine相关书籍都比较侧重对其英文手册的翻译介绍,侧重于计算机操作过程的描述。而对数据挖掘方法则较多地罗列数学公式,对于输出结果也缺少恰当的解释。
本书作者配合实际案例,侧重数据挖掘方法核心思想和基本原理的阐述,使得读者可以直观理解方法,并正确掌握方法的应用范围,不至于滥用或者误用。同时介绍软件操作,使得读者能尽快熟悉Clementine软件,从而在理解方法与掌握操作的基础上对输出结果进行合理的解释。
3.数据挖掘方法讲解通俗,软件操作过程说明翔实
针对初学者的特点,本书力求以*通俗的方式对数据挖掘方法的核心思想与基本原理进行讲解,同时避免大量罗列数学公式、数学推导与数学证明,目的是使读者能够直观地了解方法的本质,并正确运用;介绍方法的同时也紧紧围绕Clementine的输出结果展开,以使读者理解分析结论的重要性,会合理地引用分析结果。另外,本书对Clementine的操作过程也给出了较为翔实的说明,但并非是对菜单功能清单的描述,而是将其穿插于分析案例的实现过程中。
本书适合于从事数据分析各应用领域的读者,尤其适合于商业管理、财政经济、金融保险、社会研究、人文教育等行业的相关人员。同时,也能够作为高等院校计算机类、财经类、管理类专业本科生和研究生的数据挖掘教材。
本书共分十章,由薛薇、陈欢歌执笔完成,全书*后由薛薇审核定稿。本书所附光盘配备全书的案例数据和数据流文件。
由于水平所限,书中难免出现错误,敬请读者批评指正。
编著者

第1章数据挖掘和Clementine概述 1
1.1 数据挖掘的产生背景 1
1.1.1 海量数据的分析需求催生数据挖掘 1
1.1.2 应用对理论的挑战催生数据挖掘 3
1.2 什么是数据挖掘 6
1.2.1 数据挖掘的概念 6
1.2.2 数据挖掘能做什么 8
1.2.3 数据挖掘得到的知识形式 9
1.2.4 数据挖掘的算法分类 11
1.3 Clementine软件概述 14
1.3.1 Clementine的窗口 14
1.3.2 数据流的基本管理和执行 17
1.3.3 数据流的其他管理 19
1.3.4 从一个示例看Clementine的使用 21
第2章 Clementine数据的读入 30
2.1 变量的类型 30
2.1.1 从数据挖掘角度看变量类型 30
2.1.2 从数据存储角度看变量类型 31
2.2 读入数据 31
2.2.1 读自由格式的文本文件 32
2.2.2 读Excel电子表格数据 36
2.2.3 读SPSS格式文件 37
2.2.4 读数据库文件 38
2.3 生成实验方案数据 40
2.4 合并数据 42
2.4.1 数据的纵向合并 42
2.4.2 数据的横向合并 44
第3章 Clementine变量的管理 47
3.1 变量说明 47
3.1.1 取值范围和缺失值的说明 48
3.1.2 变量取值有效性检查和修正 49
3.1.3 变量角色的说明 50
3.2 变量值的重新计算 51
3.2.1 CLEM表达式 52
3.2.2 变量值重新计算示例 55
3.3 变量类别值的调整 57
3.4 生成新变量 58
3.5 变量值的离散化处理 62
3.5.1 常用的分箱方法 62
3.5.2 变量值的离散化处理示例 66
3.6 生成样本集分割变量 69
3.6.1 样本集分割的意义和常见方法 69
3.6.2 生成样本集分割变量的示例 71
第4章 Clementine样本的管理 73
4.1 样本的排序 73
4.2 样本的条件筛选 74
4.3 样本的随机抽样 75
4.4 样本的浓缩处理 76
4.5 样本的分类汇总 77
4.6 样本的平衡处理 78
4.7 样本的其他管理 79
4.7.1 数据转置 79
4.7.2 数据的重新组织 81
第5章 Clementine数据的基本分析 83
5.1 数据质量的探索 84
5.1.1 数据的基本描述与质量探索 84
5.1.2 离群点和**值的修正 87
5.1.3 缺失值的替补 88
5.1.4 数据质量管理的其他功能 89
5.2 基本描述分析 90
5.2.1 计算基本描述统计量 91
5.2.2 绘制散点图 93
5.3 变量分布的探索 94
5.4 两分类变量相关性的研究 97
5.4.1 两分类变量相关性的图形分析 97
5.4.2 两分类变量相关性的数值分析 100
5.5 两总体的均值比较 105
5.5.1 两总体均值比较的图形分析 105
5.5.2 独立样本的均值检验 107
5.5.3 配对样本的均值检验 111
5.6 变量重要性的分析 113
5.6.1 变量重要性分析的一般方法 113
5.6.2 变量重要性分析的应用示例 116
第6章分类预测:Clementine的决策树 119
6.1 决策树算法概述 119
6.1.1 什么是决策树 119
6.1.2 决策树的几何理解 121
6.1.3 决策树的核心问题 121
6.2 Clementine的C5.0算法及应用 124
6.2.1 信息熵和信息增益 124
6.2.2 C5.0的决策树生长算法 126
6.2.3 C5.0的剪枝算法 130
6.2.4 C5.0的推理规则集 132
6.2.5 C5.0的基本应用示例 136
6.2.6 C5.0的损失矩阵和Boosting技术 140
6.2.7 C5.0的模型评价 145
6.2.8 C5.0的其他话题:推理规则、交叉验证和未剪枝的决策树 147
6.3 Clementine的分类回归树及应用 148
6.3.1 分类回归树的生长过程 149
6.3.2 分类回归树的剪枝过程 151
6.3.3 损失矩阵对分类树的影响 154
6.3.4 分类回归树的基本应用示例 155
6.3.5 分类回归树的交互建模 159
6.3.6 分类回归树的模型评价 160
6.4 Clementine的CHAID算法及应用 168
6.4.1 CHAID分组变量的预处理和选择策略 168
6.4.2 Exhaustive CHAID算法 170
6.4.3 CHAID的剪枝 171
6.4.4 CHAID的应用示例 171
6.5 Clementine的QUEST算法及应用 173
6.5.1 QUEST算法确定*佳分组变量和分割点的方法 174
6.5.2 QUEST算法的应用示例 176
6.6 决策树算法评估的图形比较 177
6.6.1 不同模型的误差对比 177
6.6.2 不同模型收益的对比 178
第7章分类预测:Clementine的人工神经网络 181
7.1 人工神经网络算法概述 181
7.1.1 人工神经网络的概念和种类 181
7.1.2 人工神经网络中的节点和意义 183
7.1.3 人工神经网络建立的一般步骤 185
7.2 Clementine的B-P反向传播网络 187
7.2.1 感知机模型 188
7.2.2 B-P反向传播网络的特点 190
7.2.3 B-P反向传播算法 193
7.2.4 B-P反向传播网络的其他问题 196
7.3 Clementine的B-P反向传播网络的应用 199
7.3.1 基本操作说明 200
7.3.2 计算结果说明 202
7.3.3 提高模型预测精度 204
7.4 Clementine的径向基函数网络及应用 204
7.4.1 径向基函数网络中的隐节点和输出节点 204
7.4.2 径向基函数网络的学习过程 205
7.4.3 径向基函数网络的应用示例 207
第8章分类预测:Clementine的统计方法 209
8.1 Clementine的Logistic回归分析及应用 209
8.1.1 二项Logistic回归方程 210
8.1.2 二项Logistic回归方程系数的含义 212
8.1.3 二项Logistic回归方程的检验 214
8.1.4 二项Logistic回归分析的应用示例 218
8.1.5 多项Logistic回归分析的应用示例 224
8.2 Clementine的判别分析及应用 226
8.2.1 距离判别法 226
8.2.2 Fisher判别法 228
8.2.3 贝叶斯判别法 231
8.2.4 判别分析的应用示例 233
第9章探索内部结构:Clementine的关联分析 242
9.1 简单关联规则及其有效性 242
9.1.1 简单关联规则的基本概念 243
9.1.2 简单关联规则的有效性和实用性 245
9.2 Clementine的Apriori算法及应用 249
9.2.1 产生频繁项集 249
9.2.2 依据频繁项集产生简单关联规则 251
9.2.3 Apriori算法的应用示例 251
9.3 Clementine的GRI算法及应用 256
9.3.1 GRI算法基本思路 256
9.3.2 GRI算法的具体策略 257
9.3.3 GRI算法的应用示例 259
9.4 Clementine的序列关联及应用 260
9.4.1 序列关联中的基本概念 261
9.4.2 Sequence算法 262
9.4.3 序列关联的时间约束 266
9.4.4 序列关联分析的应用示例 266
第10章探索内部结构:Clementine的聚类分析 270
10.1 聚类分析的一般问题 270
10.1.1 聚类分析的提出 270
10.1.2 聚类分析的算法 271
10.2 Clementine的K-Means聚类及应用 271
10.2.1 K-Means对“亲疏程度”的测度 271
10.2.2 K-Means聚类过程 272
10.2.3 K-Means聚类的应用示例 275
10.3 Clementine的两步聚类及应用 279
10.3.1 两步聚类对“亲疏程度”的测度 279
10.3.2 两步聚类过程 281
10.3.3 聚类数目的确定 282
10.3.4 两步聚类的应用示例 284
10.4 Clementine的Kohonen网络聚类及应用 286
10.4.1 Kohonen网络的聚类机理 286
10.4.2 Kohonen网络的聚类过程 288
10.4.3 Kohonen网络聚类的示例 290
10.5 基于聚类分析的离群点探索及应用 295
10.5.1 多维空间基于聚类的诊断方法 296
10.5.2 多维空间基于聚类的诊断方法应用示例 299
参考文献 302