null - 程序员宅基地

spark--RDD的容错Checkpoint检查点机制-★★★★-程序员宅基地

技术标签： spark Spark

RDD的容错Checkpoint检查点机制

为什么要RDD容错-Checkpoint
如何使用RDD容错-Checkpoint
开发中如何选用?是使用缓存/持久化还是使用Checkpoint?
缓存/持久化和Checkpoint有啥区别?

为什么要RDD容错-Checkpoint

可以将计算复杂/成本较高且后续要被频繁使用到的比较重要的RDD的计算结果进行缓存/持久化到内存或磁盘上
注意:
- 这里存在内存中肯定是不安全的,因为一旦宕机内存中的数据就没了
- 而存在磁盘上也不是绝对安全,因为这里说的磁盘只是普通磁盘,不是HDFS
- 所以
- 如果想让这类比较重要的数据数据绝对的安全应该要将数据使用Checkpoint机制存放在HDFS上

如何使用RDD容错-Checkpoint

sc.setCheckpointDir("HDFS目录") //设置Checkpoint检查点目录

rdd.checkpoint() //将该rdd的结果存入Checkpoint目录,注意是调用action操作之后才真正的执行

如:

sc.setCheckpointDir("hdfs://node01:8020/ckpdir43") 
//设置检查点目录,会立即在HDFS上创建一个空目录
val rdd1 = sc.textFile("hdfs://node01:8020/wordcount/input/words.txt").flatMap(_.split(" ")).map((_,1)).reduceByKey(_+_)
rdd1.checkpoint //对rdd1进行检查点保存
rdd1.collect //Action操作才会真正执行checkpoint
//后续如果要使用到rdd1可以从checkpoint中读取

开发中如何选用?是使用缓存/持久化还是使用Checkpoint?

对于计算复杂/成本较高且后续要被频繁使用到的比较重要的RDD的计算结果
1.先进行缓存/持久化 保证后续使用的效率
2.再使用Checkpoint保证数据安全
这样既保证效率有保证安全

缓存/持久化和Checkpoint有啥区别?

1.位置不同: 缓存/持久化放内存/普通磁盘 , Checkpoint一般都是使用HDFS分布式磁盘
2.生命周期不同: 缓存/持久化会在程序结束或手动调用unpersist之后销毁 , Checkpoint会一直在HDFS直到手动销毁
3.对于依赖关系的处理不同: 缓存/持久化会记录RDD的依赖关系, Checkpoint只存结果不记录依赖关系

本文链接：https://blog.csdn.net/qq_46893497/article/details/113923371

原作者删帖不实内容删帖广告或垃圾文章投诉

智能推荐

解决electron+vue项目起始加载慢的问题_electron vue项目打开慢-程序员宅基地

文章浏览阅读461次。_electron vue项目打开慢

linux下编译GDAL外加扩展格式支持（五）--完-程序员宅基地

文章浏览阅读229次。接1、2、3、4篇。10、安装mysql支持安装fedora15或者16系统时若选择安装mysql数据库，则必须自行安装mysql开发包。因为自带默认数据库不会安装这个包。否则会遇到mysql错误：ogr_mysql.h:34:23: fatal error: my_global.h: No such file or directory#问题原因：找不到mysql头文件..._linux gdal netcdf5

Linux tc qdisc 模拟网络丢包延时-程序员宅基地

文章浏览阅读1.2k次。Linux tc qdisc 模拟网络丢包延时_tc qdisc

linux64bit 安装 jdk 1.7-程序员宅基地

文章浏览阅读336次。linux64bit 安装 jdk 1.7下载地址： https://edelivery.oracle.com/otn-pub/java/jdk/7u21-b11/jdk-7u21-linux-x64.rpm0. 卸载rpm版的jdk： #rpm -qa|grep jdk 显示：jdk-1.6.0_10-fcs 卸载：#rpm -e --nodep..._liunx64位得jdk1.7

【Linux笔记】-----Nginx/LVS/HAProxy负载均衡的优缺点_中间件应用场景nginx lvs proxy-程序员宅基地

文章浏览阅读552次。开始听到负载均衡的时候，我第一反应想到的是链路负载均衡，在此之前主要是在学习网络方面知识，像在NA、NP阶段实验做链路负载均衡时常会遇到，后来还接触到SLB负载分担技术，这都是在链路基础上实现的。其实负载均衡可以分为硬件实现负载均衡和软件实现负载均衡。硬件实现负载均衡：常见F5和Array负载均衡器，配套专业维护服务，但是成本昂贵。软件实现负载均衡：常见开源免费的负载均衡软件有Ngin..._中间件应用场景nginx lvs proxy

多维时序 | MATLAB实现CNN-LSTM多变量时序预测_cnn可以进行多步预测-程序员宅基地

文章浏览阅读4.7k次。多维时序 | MATLAB实现CNN-LSTM多变量时序预测目录多维时序 | MATLAB实现CNN-LSTM多变量多步预测基本介绍模型特点程序设计学习总结参考资料基本介绍本次运行测试环境MATLAB2020b，MATLAB实现CNN-LSTM多变量多步预测。模型特点深度学习使用分布式的分层特征表示方法自动提取数据中的从最低层到最高层固有的抽象特征和隐藏不变结构. 为了充分利用单个模型的优点并提高预测性能, 现已提出了许多组合模型。CNN 是多层前馈神经网络, 已被证明在提取隐藏_cnn可以进行多步预测

spark--RDD的容错Checkpoint检查点机制-★★★★-程序员宅基地

RDD的容错Checkpoint检查点机制

为什么要RDD容错-Checkpoint

如何使用RDD容错-Checkpoint

开发中如何选用?是使用缓存/持久化还是使用Checkpoint?

缓存/持久化和Checkpoint有啥区别?

智能推荐

解决electron+vue项目起始加载慢的问题_electron vue项目打开慢-程序员宅基地

linux下编译GDAL外加扩展格式支持（五）--完-程序员宅基地

Linux tc qdisc 模拟网络丢包延时-程序员宅基地

linux64bit 安装 jdk 1.7-程序员宅基地

【Linux笔记】-----Nginx/LVS/HAProxy负载均衡的优缺点_中间件应用场景nginx lvs proxy-程序员宅基地

多维时序 | MATLAB实现CNN-LSTM多变量时序预测_cnn可以进行多步预测-程序员宅基地

随便推点

【9.3】用户和组的管理、密码_polkitd:input 用户和组-程序员宅基地

pca算法python代码_三种方法实现PCA算法（Python）-程序员宅基地

内存地址Linux下内存分配与映射之一-程序员宅基地

自动化测试介绍_自动化测试中baw库指的什么-程序员宅基地

a0图框标题栏尺寸_a0图纸尺寸(a0图纸标题栏尺寸标准国标)-程序员宅基地

TreeTable的简单实现_treetable canvas-程序员宅基地

推荐文章

热门文章

相关标签