开发者社区> 问答> 正文

spark当中RDD 如何通过记录更新的方式容错?

spark当中RDD 如何通过记录更新的方式容错?

展开
收起
游客ahv54x37wvm7u 2021-12-12 21:02:13 865 0
1 条回答
写回答
取消 提交回答
  • RDD 的容错机制实现分布式数据集容错方法有两种: 1. 数据检查点 2. 记录更新。

    RDD 采用记录更新的方式:记录所有更新点的成本很高。所以,RDD只支持粗颗粒变换,即只记录单个块(分区)上执行的单个操作,然后创建某个 RDD 的变换序列(血统 lineage)存储下来;变换序列指,每个 RDD 都包含了它是如何由其他 RDD 变换过来的以及如何重建某一块数据的信息。因此 RDD 的容错机制又称“血统”容错。

    2021-12-12 21:02:24
    赞同 展开评论 打赏
问答排行榜
最热
最新

相关电子书

更多
Hybrid Cloud and Apache Spark 立即下载
Scalable Deep Learning on Spark 立即下载
Comparison of Spark SQL with Hive 立即下载