SPARK高级数据分析(影印版)

企业采购书卡请拔打028-83157469,团购书目请拨打19113427458(法定工作日9:00-17:00)

定  价 :
¥ 56.00
文 轩 价 :
¥44.80 (8折)
库  存 :
库存紧张
作  者 :
(美)里扎(Sandy Ryza) 等 著
所属分类 :
图书 > 行业职业 > 计算机 > 英文原版书
促销活动 :
❤图书音像单笔满100减30!(特价图书、电子书除外)
❤老客户回馈,积分换礼券,购书更实惠
❤图书订单满39元包邮,不足收取运费6元(新疆西藏运费每单20元)
详情 >>
购买数量 :
- +
立即购买
服  务 :
由"文轩网"直接销售和发货,并提供售后服务
正品低价| 闪电发货|货到付款| 高效退换货
  • 作 者: (美)里扎(Sandy Ryza) 等 著
  • 出版社: 东南大学出版社
  • 出版时间:2015-09-01
  • 开 本:16开
  • 页 数:260
  • 印刷时间:2015-09-01
  • 字 数:338.00千字
  • 装 帧:平装
  • 语  种:英语
  • 版 次:1
  • 印 次:1
  • I S B N:9787564159108

目录

Foreword
Preface
1.Analyzing Big Data
The Challenges of Data Saence
Introduang Apache Spark
About This Book
2.Introduction to Data Analysis with Scala and Spark
Scala for Data Scientists
The Spark Programming Model
Record Linkage
Getting Started: The Spark Shell and Spark Context
Bringing Data from the Cluster to the Client
Shipping Code from the Client to the Cluster
Structuring Data with Tuples and Case Classes
Aggregations
Creating Histograms
Summary Statistics for Continuous Variables
Creating Reusable Code for Computing Summary Statistics
Simple Variable Selection and Scoring
Where to Go from Here
3.Recommending Music and the Audioscrobbler Data Set
Data Set
The Alternating Least Squares Recommender Algorithm
Preparing the Data
Building a First Model
Spot Checking Recommendations
Evaluating Recommendation Quality
Computing AUC
Hyperparameter Selection
Making Recommendations
Where to Go from Here
4.Predicting Forest Cover with Deasion Trees
Fast Forward to Regression
Vectors and Features
Training Examples
Decision Trees and Forests
Covtype Data Set
Preparing the Data
A First Decision Tree
Deasion Tree Hyperparameters
Tuning Decision Trees
Categorical Features Revisited
Random Decision Forests
Making Predictions
Where to Go from Here
5.Anomaly Detection in Network Traffic with K—means Clustering
Anomaly Detection
K—means Clustering
Network Intrusion
KDD Cup 1999 Data Set
A First Take on Clustering
Choosing k
Visualization in R
Feature Normalization
Categorical Variables —
Using Labels with Entropy
Clustering in Action
Where to Go from Here
6.Understanding Wikipedia with Latent Semantic Analysis
The Term—Document Matrix
Getting the Data
Parsing and Preparing the Data
Lemmatization
Computing the TF—IDFs
Singular Value Decomposition
Finding Important Concepts
Querying and Scoring with the Low—Dimensional Representation
Term—Term Relevance
Document—Document Relevance
Term—Document Relevance
Multiple—Term Queries
Where to Go from Here
7.Analyzing Co—occurrence Networks with GraphX
The MEDLINE Citation Index: A Network Analysis
Getting the Data
Parsing XML Documents with Scala's XML Library
Analyzing the MeSH Major Topics and Their Co—occurrences
Constructing a Co—occurrence Network with GraphX
Understanding the Structure of Networks
Connected Components
Degree Distribution
Filtering Out Noisy Edges
Processing Edge Triplets
Analyzing the Filtered Graph
Small—World Networks
Cliques and Clustering Coefficients
Computing Average Path Length with Pregel
Where to Go from Here
8.Geospatial and Temporal Data Analysjs on the New York City Taxi Trip Data
Getting the Data
Working with Temporal and Geospatial Data in Spark
Temporal Data with Joda Time and NScala Time
Geospatial Data with the Esri Geometry API and Spray
Exploring the Esri Geometry API
Intro to GeolSON
Preparing the New York City Taxi Trip Data
Handling Invalid Records at Scale
Geospatial Analysis
Sessionization in Spark
Building Sessions: Secondary Sorts in Spark
Where to Go from Here
9.Estimating Financial Risk through Monte Carlo Simulation
Terminology
Methods for Calculating VaR
Variance—Covariance
Historical Simulation
Monte Carlo Simulation
Our Model
Getting the Data
Preprocessing
Determining the Factor Weights
Sampling
The Multivariate Normal Distribution
Running the Trials
Visualizing the Distribution of Returns
Evaluating Our Results
Where to Go from Here
10.Analyzing Genomics Data and the BDG Project
Decoupling Storage from Modeling
Ingesting Genomics Data with the ADAM CLI
Parquet Format and Columnar Storage
Predicting Transcription Factor Binding Sites from ENCODE Data
Querying Genotypes from the 1000 Genomes Project
Where to Go from Here
11.Analyzing Neuroimaging Data with PySpark and Thunder
Overview of PySpark
PySpark Internals
Overview and Installation of the Thunder Library
Loading Data with Thunder
Thunder Core Data Types
Categorizing Neuron Types with Thunder
Where to Go from Here
A.Deeper into Spark
B.Upcoming MLlib Pipelines API
Index

作者简介

Sandy Ryza,是Cloudera的不错数据科学家,也是Apache Spark项目的活跃贡献者。

内容简介

网络数据量迅速增大的时代,亟需能高效迅捷分析处理数据的工具,Spark应运而生。本书由Spark开发者及核心成员打造,带领读者快速掌握用Spark收集、计算、简化 保存海量数据的方法,学会交互、迭代和增量式分析,解决分区、数据本地化和自定义序列化等问题。

价格说明

定价:为出版社全国统一定价;

文轩价:为商品的销售价,是您最终决定是否购买商品的依据;受系统缓存影响,最终价格以商品放入购物车后显示的价格为准;

关于新广告法声明

新广告法规定所有页面信息中不得出现绝对化用词和功能性用词。

本店非常支持新广告法,但为了不影响消费者正常购买,页面明显区域本店已在排查修改,对于不明显区域也将会逐步排查并修改,我们此郑重声明:本店所有页面上的绝对化用词与功能性用词在此声明全部失效,不作为赔付理由。涉及“教育部声明”中的商品,均不代表教育部指定、推荐的具体版本,仅代表该商品的内容为指定、推荐书目。因极限用词引起的任何形式的商品赔付,本店不接收且不妥协。希望消费者理解并欢迎联系客服帮助完善,也请职业打假人士高抬贵手。