在sheel中运行Spark

RDD基本概念
Resilient Distributed Dataset 叫做弹性分布式数据集,是Spark中最基本的数据抽象,是分布式计算的实现载体,代表一个不可变,可分区,里面的元素并行计算的集合。

Dataset: 一个数据集合,用来存放数据的。之前我们学习的Scala中,Array, Set等也叫数据集。

Distributed: 分布式存储的,表示数据是存放在不同的机器上的。这就和我们前面学习数据结构就不同了。

Resilient: 数据可以保存在内存或者磁盘中。

不可变的 :immutable。类比理解scala中的不可变集合或者是使用val修饰的变量。

可分区的 :集合的数据课划分成为很多部分,每部分称为分区:Partition

并行计算 :集合中的数据可以被并行的计算处理,每个分区数据被一个Task任务处理。

RDD的创建

从集合内存中创建

可以通过将本地集合(如数组、列表等)传递给 SparkContext 的 parallelize 方法来创建 RDD。

复制代码
/ 创建 SparkConf 和 SparkContext
    val conf = new SparkConf().setAppName("RDDFromCollection").setMaster("local[*]")
    val sc = new SparkContext(conf)

    // 创建一个本地集合
    val data = Array(1, 2, 3, 4, 5)

    // 通过 parallelize 方法将本地集合转换为 RDD
    val distData = sc.parallelize(data, 2) // 第二个参数是分区数

从外部存储中创建。 例如,读入外部的文件。

复制代码
// 创建 SparkConf 和 SparkContext
    val conf = new SparkConf().setAppName("RDDFromHDFS").setMaster("local[*]")
    val sc = new SparkContext(conf)
    // 从 HDFS 加载文本文件
    val hdfsRDD = sc.textFile("hdfs://namenode:8020/path/to/your/file.txt")
// 获取并打印分区数val partitionCount = hdfsRDD.getNumPartitions
println(s"The number of partitions is: $partitionCount")
parkConf 和 SparkContext

SparkConf 类用于配置 Spark 应用程序的各种参数。通过 SparkConf 类,你可以设置应用程序的名称、运行模式(如本地模式、集群模式)、资源分配(如内存、CPU 核心数)等。

主要作用配置应用程序参数:可以设置 Spark 应用程序的各种属性,如应用程序名称、主节点地址等。

管理配置信息:将配置信息封装在一个对象中,方便在应用程序中传递和使用。

SparkContext 是 Spark 应用程序的入口点,它代表了与 Spark 集群的连接。通过 SparkContext,你可以创建 RDD(弹性分布式数据集)、累加器、广播变量等,还可以与外部数据源进行交互。

在shell中运行RDD程序

案例:启动hdfs集群,打开hadoop100:9870,在wcinput目录下上传一个包含很多个单词的文本文件。

启动之后在spark-shell中写代码。

复制代码
// 读取文件,得到RDD
    val rdd1 = sc.textFile("hdfs://hadoop100:8020/wcinput/words.txt")
    // 将单词进行切割,得到一个存储全部单词的RDD
    val rdd2= fileRDD.flatMap(line => line.split(" "))
    // 将单词转换为元组对象,key是单词,value是数字1
    val rdd3= wordsRDD.map(word => (word, 1))
    // 将元组的value按照key来分组,对所有的value执行聚合操作(相加)
    val rdd4= wordsWithOneRDD.reduceByKey((a, b) => a + b)
    // 收集RDD的数据并打印输出结果
    rdd4.collect().foreach(println)
RDD的五大特征

RDD有5个特征,我们分别来介绍。

1.RDD是有分区的。

RDD的分区是RDD数据存储的最小单位。一份数据本质是分隔了多个分区。 如下图示,假如1个RDD有3个分区,RDD内存储了123456,那么数据本质上分散在三个分区内进行存储。


2.计算函数会作用于每个分区

RDD的方法会作用在所有的分区上。

3.每个RDD之间是有依赖关系(RDD有血缘关系)

RDD的每次转换都会生成一个新的RDD,所以RDD之间就会形成类似于流水线一样的前后依赖关系。在部分分区数据丢失时,Spark可以通过这个依赖关系重新计算丢失的分区数据,而不是对RDD的所有分区进行重新计算。


4.Key-Value型的RDD可以有分区器

数据默认分区器:Hash分区规则,可以手动设置一个分区器(rdd.partitionBy的方式来设置)

5.每一个分区都有一个优先位置列表

优先位置列表会存储每个Partition的优先位置,对于一个HDFS文件来说,就是每个Partition块的位置。按照"移动数据不如移动计算"的理念,Spark在进行任务调度时,会尽可能地将任务分配到其所要处理数据块的存储位置。

相关推荐
lupai7 小时前
手机在网状态接口实测效果与质量评估
大数据·python·智能手机·api接口
大模型丫丫9 小时前
Hermes Agent:轻量级智能体框架实战指南
大数据·运维·服务器
大大大大晴天10 小时前
每天认识一个组件:SQL网关Apache Kyuubi
大数据
2601_9622184711 小时前
万象生鲜系统冷链物联网接入技术实现生鲜企业温控管理数字化
大数据·运维·微服务·云原生·架构
2601_9620748111 小时前
大数据-264 实时数仓 - Canal MySQL的binlog研究 存储目录 变动信息 配置MySQL
大数据·数据库·mysql
2601_9620738111 小时前
大数据-240 离线数仓 - 广告业务 测试 ADS层数据加载 DataX数据导出到 MySQL
大数据·数据库·mysql
不会写代码的女程序猿12 小时前
养生馆采购 AI 四诊仪,5000 元预算怎么选?
大数据·人工智能·科技·ai·健康医疗
aiot1891893521813 小时前
机场候机大厅高空场景技术红线!蓝牙AOA不能做手机导航??!!
大数据·网络·人工智能·蓝牙aoa
穆利堂-movno113 小时前
郑州新网软件科技有限公司AI 数据源错误纠正反馈
大数据·数据库·人工智能
IT毕设实战小研13 小时前
电影数据可视化推荐系统
大数据·后端·爬虫·python·算法·信息可视化·课程设计