Spark RDD序列化与血缘关系

最新推荐文章于 2024-06-22 16:58:41 发布

冉半夏生

最新推荐文章于 2024-06-22 16:58:41 发布

阅读量1.3k

点赞数

CC 4.0 BY-SA版权

分类专栏： Spark 文章标签： spark 大数据

本文链接：https://blog.csdn.net/tyh1579152915/article/details/117919414

本文深入探讨了Spark中的RDD序列化机制，包括闭包检查和Kryo序列化框架，强调了序列化在分布式计算中的重要性。同时，文章详细阐述了RDD的血缘关系（Lineage），说明了如何通过血缘关系恢复丢失数据分区。示例代码展示了RDD操作导致的任务序列化问题及其解决方案。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

RDD序列化

从计算的角度, 算子以外的代码都是在 Driver 端执行, 算子里面的代码都是在 Executor端执行。所以需要涉及到网络传输，且如果计算中涉及到算子以外的数据那么就要求这个数据进行序列化，因为没有序列化就代表无法进行网络传输也就无法将值传到其它Excutor端执行，就会发生错误。

（1）闭包检查
在scala的函数式编程中，函数内经常会用到函数外变量，这样就会形成闭包效果，因此，在分布式系统中，就会存在对象需要在Driver和Executor间传递，那么就需要传递的对象被序列化，因此在计算之前就会进行闭包检查，即检查使用到的对象是否进行了序列化。

（2）Kryo序列化框架
这个序列化框架不同于Java的序列化框架，相比于java的序列化框架，这个框架速度更快，生成的序列化文件更小，而且这个框架会忽略Java的一些序列化机制，例如Java中使用了transient关键字忽略对一些数据的序列化，而Kryo会忽略这个关键字。Spark 出于性能的考虑，Spark2.0 开始支持另外一种 Kryo 序列化机制。Kryo 速度是 Serializable 的 10 倍。当 RDD 在 Shuffle 数据的时候，简单数据类型、数组和字符串类型已经在 Spark 内部使用 Kryo 来序列化。

样例：

def main(args: Array[String]): Unit = {
   
   
    val conf: SparkConf = new SparkConf().setAppName("SparkCoreTest").setMaster("local[2]")
    val sc: SparkContext = new SparkContext(conf)

    val rdd: RDD[String] = sc.makeRDD(Array("hello world",