即将发布的 Apache Spark 2.4 都有哪些新功能
Posted 过往记忆大数据
tags:
篇首语:本文由小常识网(cha138.com)小编为大家整理,主要介绍了即将发布的 Apache Spark 2.4 都有哪些新功能相关的知识,希望对你有一定的参考价值。
本文来自于2018年09月19日在 Adobe Systems Inc 举行的 Apache Spark Meetup。
即将发布的 Apache Spark 2.4 版本是 2.x 系列的第五个版本。 本文对 Apache Spark 2.4 的主要功能和增强功能进行了概述。
新的调度模型(Barrier Scheduling),使用户能够将分布式深度学习训练恰当地嵌入到 Spark 的 stage 中,以简化分布式训练工作流程。
添加了35个高阶函数,用于在 Spark SQL 中操作数组/map。
新增一个新的基于 Databricks 的 spark-avro 模块的原生 AVRO 数据源。
PySpark 还为教学和可调试性的所有操作引入了热切的评估模式(eager evaluation mode)。
Spark on K8S 支持 PySpark 和 R ,支持客户端模式(client-mode)。
Structured Streaming 的各种增强功能。 例如,连续处理(continuous processing)中的有状态操作符。
内置数据源的各种性能改进。 例如,Parquet 嵌套模式修剪(schema pruning)。
支持 Scala 2.12。
回复 spark_summit_201806 下载 Spark Summit North America 201806 全部PPT
0、回复 电子书 获取 本站所有可下载的电子书
1、
2、
3、
4、
5、
6、
7、
8、
9、
10、
以上是关于即将发布的 Apache Spark 2.4 都有哪些新功能的主要内容,如果未能解决你的问题,请参考以下文章
即将发布的 Apache Spark 3.2 将内置 Pandas API
即将发布的 Apache Spark 3.2 将内置 Pandas API
Magnet:即将随 Apache Spark 3.2 发布的高性能外部 Shuffle 服务
Magnet:即将随 Apache Spark 3.2 发布的高性能外部 Shuffle 服务