Spark

Spark工作原理及基础概念(超详细!)_spark原理-CSDN博客

初识 Spark - 7000字+15张图解,学习 Spark 入门基础知识-腾讯云开发者社区-腾讯云

Spark基本概念

分布式并行计算框架

Spark是加州大学伯克利分校AMP实验室(Algorithms, Machines, and People Lab)开发的通用内存并行计算框架,借鉴了MapReduce之上发展而来的,继承了其分布式并行计算的优点并改进了MapReduce明显的缺陷。使用场景如下:

  • 复杂的批量处理(Batch Data Processing),偏重点在于处理海量数据的能力,至于处理速度可忍受,通常的时间可能是在数十分钟到数小时;
  • 基于历史数据的交互式查询(Interactive Query),通常的时间在数十秒到数十分钟之间
  • 基于实时数据流的数据处理(Streaming Data Processing),通常在数百毫秒到数秒之间
  • Spark 已经成为大数据领域中必备的计算引擎框架
  • Spark 已经基本替代了传统的 MapReduce 离线计算框架和 Storm 流式实时计算框架

1,Spark 的特性

1,Simple 简单易用,spark封装了java python SQL等语言API

2,Fast 比MR快很多

3,Scalable(可融合性)。 使用Hadoop YARN 作用资源管理及调度器

4,Unified(统一通用)。之前离线任务计算用MR,实时流任务计算用storm,这个都支持

2,优势

1,高性能,MR计算结果放在HDFS磁盘上,Spark计算结果放在内存中,内存不够,放磁盘中

3,Spark 的生态圈(组成模块)

4,Spark 的运行原理

1,Spark 的运行模式

2,Spark 的集群架构及角色

Spark 的集群架构主要由 Cluster Manager(集群资源管理器)、Worker (工作节点)、Executor(执行器)、Driver(驱动器)、Application(应用程序)共五部分角色组成


spark与hive结合

两条路线

Spark On Hive (Hive只用于连接数据源)

Hive On Spark

谁在前谁负责解析sql,最终的执行逻辑都是RDD(Spark代替了MR)

代码示例

jar依赖

core 对应RDD

sql

相关推荐
大模型码小白16 小时前
【Python零基础教程】继承、多态与魔法函数:面向对象编程三大核心特性详解
java·大数据·开发语言·人工智能·python·ai编程
延凡科技18 小时前
多场景落地复盘:端边云架构无人机智能巡检系统设计与实践
大数据·数据结构·人工智能·科技·架构·无人机·能源
wWYy.18 小时前
分布式:数据复制
分布式
ifenxi爱分析19 小时前
爱分析最新报告解读:AI数据基础设施与数据中台的区别
大数据·人工智能
品牌全球行20 小时前
共商共建共享 链接数字未来——“一带一路数字新城(深圳)会客厅筹备办”揭牌仪式在深圳隆重举行
大数据·人工智能
数智化管理手记1 天前
账龄分析手工统计易遗漏?自动账龄分析工具怎么搭建
大数据·网络·数据库·人工智能·数据挖掘
ApacheSeaTunnel1 天前
Apache SeaTunnel AI CLI Benchmark:7 款大模型、100 个 ETL 任务实测,谁真正能跑起来?
大数据·ai·开源·大模型·数据集成·cli·seatunnel·技术分享·数据同步
电商API_180079052471 天前
企业ERP进销存场景|京东商品详情接口自动同步方案|凭证鉴权批量调用技术实操
大数据·运维·人工智能·爬虫·数据挖掘·网络爬虫
小稻穗1 天前
市场调研样本选型坐标系:2026六家国内样本平台能力横向校验
大数据·运维·数据分析
极光代码工作室1 天前
基于Spark的日志监控与分析平台
大数据·hadoop·python·spark·数据可视化