题名:Spark高级数据分析
作者:(美) Sandy Ryza ... [等] 著
出版年:2015
ISBN: 978-7-115-40474-9
分类号: TP274
中图分类: 数据处理、数据处理系统
译者: 龚少成
定价: 59.00元
页数: 244 页
出版社: 人民邮电出版社
装订: 平装

本书是使用Spark进行大规模数据分析的实战宝典,由著名大数据公司Cloudera的数据科学家撰写。四位作者首先结合数据科学和大数据分析的广阔背景讲解了Spark,然后介绍了用Spark和Scala进行数据处理的基础知识,接着讨论了如何将Spark用于机器学习,同时介绍了常见应用中几个最常用的算法。此外还收集了一些更加新颖的应用,比如通过文本隐含语义关系来查询Wikipedia或分析基因数据。

Sandy Ryza
是Cloudera公司资深数据科学家,Apache Spark项目的活跃代码贡献者。最近领导了Cloudera公司的Spark开发工作。他还是Hadoop项目管理委员会委员。
Uri Laserson
是Cloudera公司资深数据科学家,专注于Hadoop生态系统中的Python部分。
Sean Owen
是Cloudera公司EMEA地区的数据科学总监,也是Apache Spark项目的代码提交者。他创立了基于Spark、Spark Streaming和Kafka的Hadoop实时大规模学习项目Oryx(之前称为Myrrix)。
Josh Wills
是Cloudera公司的高级数据科学总监,Apache Crunch项目的发起者和副总裁。