新書推薦:
《
宠物驯养技术
》
售價:HK$
54.8
《
混一戎华:元朝统一中国的历史进程
》
售價:HK$
107.8
《
中国高句丽史(第二版)
》
售價:HK$
217.8
《
征税的权力——财政制度的分析基础
》
售價:HK$
72.6
《
吴宓师友书札
》
售價:HK$
74.8
《
清朝生活实录
》
售價:HK$
86.9
《
人群行为识别理论与视觉AI技术研究
》
售價:HK$
178.2
《
个人经济体崛起时代 普通人的时代红利 黄金宝 王万军 著 披露超级个体爆红背后的秘密 创业 个体创业 平台创业 个人IP打造
》
售價:HK$
74.8
編輯推薦:
在数据规模急速膨胀的大数据时代,数据挖掘这项甄别重要数据的核心技术正发挥越来越重要的作用。它将赋予你解决实际问题的超能力:预测体育赛事结果、投放广告、根据作品的风格解决作者归属问题,等等。本书使用简单易学且拥有丰富第三方库和良好社区氛围的Python语言,由浅入深,以真实数据作为研究对象,真刀实枪地向读者介绍Python数据挖掘的实现方法。通过本书,读者将迈入数据挖掘的殿堂,透彻理解数据挖掘基础知识,掌握解决数据挖掘实际问题的杰出实践!
內容簡介:
本书作为数据挖掘入门读物,介绍了数据挖掘的基础知识、基本工具和实践方法,通过循序渐进地讲解算法,带你轻松踏上数据挖掘之旅。本书采用理论与实践相结合的方式,呈现了如何使用决策树和随机森林算法预测美国职业篮球联赛比赛结果,如何使用亲和性分析方法推荐电影,如何使用朴素贝叶斯算法进行社会媒体挖掘,等等。本书也涉及神经网络、深度学习、大数据处理等内容。
來源:香港大書城megBookStore,http://www.megbook.com.hk 本书面向愿意学习和尝试数据挖掘的程序员。
關於作者:
Robert Layton,计算机科学博士,网络犯罪问题和文本分析方面的专家。多年来一直热衷于Python编程,参与过scikit-learn库等很多开源库的开发,曾担任2014年度谷歌编程之夏项目导师。他曾与全球几大数据挖掘公司密切合作,挖掘真实数据并研发相关应用。他的公司dataPipeline为多个行业提供数据挖掘和数据分析解决方案。
目錄 :
目录
第1章 开始数据挖掘之旅 1
1.1 数据挖掘简介 1
1.2 使用Python 和IPython Notebook 2
1.2.1 安装Python 2
1.2.2 安装IPython 4
1.2.3 安装scikit-learn 库 5
1.3 亲和性分析示例 5
1.3.1 什么是亲和性分析 5
1.3.2 商品推荐 6
1.3.3 在NumPy 中加载数据集 6
1.3.4 实现简单的排序规则 8
1.3.5 排序找出最佳规则 10
1.4 分类问题的简单示例 12
1.5 什么是分类 12
1.5.1 准备数据集 13
1.5.2 实现OneR 算法 14
1.5.3 测试算法 16
1.6 小结 18
第2章 用scikit-learn 估计器分类 19
2.1 scikit-learn 估计器 19
2.1.1 近邻算法 20
2.1.2 距离度量 20
2.1.3 加载数据集 22
2.1.4 努力实现流程标准化 24
2.1.5 运行算法 24
2.1.6 设置参数 25
2.2 流水线在预处理中的应用 27
2.2.1 预处理示例 28
2.2.2 标准预处理 28
2.2.3 组装起来 29
2.3 流水线 29
2.4 小结 30
第3章 用决策树预测获胜球队 31
3.1 加载数据集 31
3.1.1 采集数据 31
3.1.2 用pandas 加载数据集 32
3.1.3 数据集清洗 33
3.1.4 提取新特征 34
3.2 决策树 35
3.2.1 决策树中的参数 36
3.2.2 使用决策树 37
3.3 NBA 比赛结果预测 37
3.4 随机森林 41
3.4.1 决策树的集成效果如何 42
3.4.2 随机森林算法的参数 42
3.4.3 使用随机森林算法 43
3.4.4 创建新特征 44
3.5 小结 45
第4章 用亲和性分析方法推荐电影 46
4.1 亲和性分析 46
4.1.1 亲和性分析算法 47
4.1.2 选择参数 47
4.2 电影推荐问题 48
4.2.1 获取数据集 48
4.2.2 用pandas 加载数据 49
4.2.3 稀疏数据格式 49
4.3 Apriori 算法的实现