spark

阿里云大数据AI技术1 天前
大数据·人工智能·spark
Daft 多模态视频抽帧性能优化实践:从抽帧到大模型打标,一条视频理解流水线是怎么跑起来的过去两年,多模态大模型的能力跃升让"把视频喂给模型,让它看懂画面里发生了什么"成为越来越多用户的实际需求;与此同时,监控录像、直播回放、UGC 内容、工业质检影像等场景产生的视频数据动辄以 TB 计。要把这些数据变成可检索、可分析的结构化信息,"视频抽帧 + 大模型理解"成了最直接的路线。
starzy19902 天前
大数据·spark
Spark 核心之 Shuffle 文件寻址详解摘要:Reduce Task 如何找到成百上千个 Map Task 输出的 Shuffle 文件?如何精准定位到目标分区的数据块?本文从 MapOutputTracker 全局注册表、MapStatus 元数据结构、IndexShuffleBlockResolver 的 Index→Data 解析链、Netty 远程 Block 拉取、ExternalShuffleService 退出守护五个维度,配合 2 张架构图 + 源码追踪,完整拆解 Spark Shuffle 文件寻址的端到端流程。
FserSuN2 天前
大数据·分布式·spark
回顾Spark的概念与应用本文基于 Spark 3.x 版本(生产环境使用 Spark 3.2+,Python 3.9)。以下概念和优化方案均以 Spark 3.x 为基础,部分特性(如 AQE 自适应执行、pandas_udf 的 @pandas_udf 装饰器语法)在 Spark 2.x 中不可用或 API 不同。
用户3610588626122 天前
大数据·spark
SparkSQL 数据源与底层架构深度剖析摘要:SparkSQL 作为 Apache Spark 生态中最核心的模块之一,不仅提供了统一的 SQL 查询入口,更承载了 DataFrame/Dataset API 的全部执行能力。本文从数据源接入机制入手,深入 Catalyst 优化器四阶段流水线、WholeStageCodegen 代码生成、Tungsten 执行引擎等核心组件,结合源码级追踪,全面剖析 SparkSQL 底层架构设计。无论你是日常写 SQL 的数据工程师,还是需要调优 Spark 作业的架构师,这篇文章都会让你对 SparkSQ
用户3610588626122 天前
大数据·spark
SparkSQL 之 DataFrame 与 DataSet 及实操演练摘要:从 RDD 到 DataFrame 再到 DataSet,Spark 的 API 经历了三次重大进化。DataFrame = DataSet[Row](有 Schema 但无类型),DataSet[T] = RDD 的类型安全 + DataFrame 的 Catalyst 优化。本文从三层 API 架构全景、RDD/DataFrame/DataSet 创建与互转、Catalyst 优化器四阶段、Encoder 序列化机制、生产环境最佳实践五个维度,配合 1 张原创深色架构图 + 完整可运行实操代码,
BYSJMG2 天前
大数据·hadoop·信息可视化·spark·课程设计
计算机毕业设计选题推荐|【基于大数据的城市噪音数据可视化分析】Spark+K-Means+FP-Growth实战精彩专栏推荐订阅:在下方主页👇🏻👇🏻👇🏻👇🏻💖🔥作者主页:计算机毕设木哥🔥 💖
starzy19903 天前
大数据·分布式·架构·spark
SparkSQL 数据源与底层架构深度剖析摘要:SparkSQL 作为 Apache Spark 生态中最核心的模块之一,不仅提供了统一的 SQL 查询入口,更承载了 DataFrame/Dataset API 的全部执行能力。本文从数据源接入机制入手,深入 Catalyst 优化器四阶段流水线、WholeStageCodegen 代码生成、Tungsten 执行引擎等核心组件,结合源码级追踪,全面剖析 SparkSQL 底层架构设计。无论你是日常写 SQL 的数据工程师,还是需要调优 Spark 作业的架构师,这篇文章都会让你对 SparkSQ
roman_日积跬步-终至千里3 天前
大数据·sql·spark
【Spark与SQL网关(1)】Spark 提交模式与 Spark Thrift Server:到底在“提交”什么很多 Spark 使用者对两件事一直模糊: 一是 client / cluster 到底差在哪; 二是 STS(Spark Thrift Server)算不算一种提交模式。
starzy19904 天前
大数据·spark
Spark 核心之 Spark-SortShuffle 原理深度剖析摘要:Shuffle 是 Spark 作业中最昂贵的操作,也是性能瓶颈的高发区。Spark 2.0 起 SortShuffleManager 成为唯一的默认实现,通过 ExternalSorter 分区排序 + 溢写归并 + Index File 精确索引三大机制,彻底解决了 HashShuffle 的 M×R 文件爆炸问题。本文从 SortShuffleManager 的三种 ShuffleHandle 选择策略、ExternalSorter 溢写与归并流程、Index File 索引机制、Tungst
用户3610588626124 天前
大数据·spark
Spark 核心之 Spark 内存管理深度剖析摘要:Spark 内存管理是性能调优的核心战场——理解 UnifiedMemoryManager 的 Execution/Storage 动态借用机制、Tungsten 页式分配、Off-Heap 与 On-Heap 的权衡、以及 acquire → evict → spill 的分配溢出流程,是避免 OOM、提升 Shuffle 效率的关键。本文从 JVM Heap 分区架构、Unified vs Static 对比、内存分配失败处理链、Tungsten MemoryAllocator、堆外内存与常见
乌恩大侠5 天前
人工智能·spark·aerial·o-ru·ai-ran
【AI-RAN】硬件产品:DELL 前传交换机面向 NVIDIA Aerial、O-RAN 7.2x、5G/6G 与 AI-RAN 实验平台的高性能以太网交换机
starzy19905 天前
大数据·ajax·spark
Spark 核心之自定义累加器以及版本对比变化深度剖析摘要:Spark 1.x 的 Accumulator 接口存在严重设计缺陷:类型单调(IN=OUT)、无法自定义扩展、内置实现仅 4 种。Spark 2.0 引入了 AccumulatorV2[IN,OUT] 重构了整个累加器体系,通过 7 个核心抽象方法(add / merge / copy / copyAndReset / reset / isZero / value)实现了完全可扩展的累加器框架。本文从 Accumulator → AccumulatorV2 接口演化、自定义累加器实现模式、Exec
用户3610588626125 天前
大数据·spark
Spark 核心之 Spark-SortShufflebypass 原理深度剖析摘要:BypassMergeSortShuffle 是 SortShuffleManager 提供的最轻量 Shuffle Write 路径——它绕过排序、绕过聚合,直接为每个分区写独立文件最后合并,省去了 ExternalSorter 的全部开销。本文从触发条件、分区直写流程、Index File 生成、与 SortShuffleWriter/UnsafeShuffleWriter 的决策树对比四个维度,配合 2 张原创架构图 + 源码追踪,彻底拆解这一极速 Shuffle 路径的原理与适用边界。
starzy19905 天前
大数据·分布式·spark
Spark 核心之二次排序、分组取 TopN 优化分析摘要:为什么你的分组 TopN 任务跑了 30 分钟还 OOM?答案通常是四个字——groupByKey。本文将二次排序和分组 TopN 作为两条优化主线,从反模式剖析、三种方案对比(groupByKey / reduceByKey+mapPartitions / SQL 窗口函数)、groupByKey vs reduceByKey 本质区别、完整代码实战、Spark SQL 窗口函数最佳实践五个维度,配合 1 张原创深色架构图,助你彻底攻克 TopN 优化的每一个细节。
乌恩大侠6 天前
人工智能·spark·o-ru·ai-ran
图解 AI-RAN开发需要哪些软硬件:O-RU、DGX Spark、Sionna与Aerial
阿里云大数据AI技术7 天前
人工智能·spark
阿里云 EMR Daft AI Function:用 DataFrame 表达式搞定大模型调用与多模态向量化导读:当用户在 DataFrame 处理链路中需要引入大模型能力,或需要统一处理文本、图片、视频等多模态数据时,推荐在阿里云 EMR Serverless Spark 上使用 Daft AI Function 方案。无需拆分脚本、无需管理模型服务端点,像写普通列转换一样完成 AI 推理与向量化。
BD_Marathon7 天前
大数据·ajax·spark
开发Spark应用程序Spark应用程序包含两个部分:一个是Spark集群,另一个是你的代码。在本例中,集群被设置为本地模式,应用程序是预定义的
BD_Marathon7 天前
大数据·javascript·spark
部署Spark本章探讨Spark的基础架构,了解这些有助于部署和运行Spark应用程序在大多数情况下,Spark在各种集群管理器下的工作模式类似。然而,定制集群管理器就需要了解每个集群管理系统的工作原理,最困难的部分是选择集群管理器(或选择托管服务)
Blossom i7 天前
大数据·hadoop·spark
Python+spark2.0+Hadoop机器学习与大数据实战第十一章:Python Spark的集成开发环境虚拟机安装JDK1.8 JDK的下载,可以官网下载(可以选着版本),也可以从下面百度网盘链接下载(版本固定)
用户3610588626128 天前
大数据·spark
Spark 核心之广播变量、累加器原理深度剖析摘要:Spark 分布式计算的本质是"数据分发 + 并行处理"。但在 Executor 之间共享变量时,常规做法(如闭包引用)会导致严重的性能问题——大变量重复序列化传输、更新不可见。Spark 提供了两种分布式共享变量解决此难题:广播变量(Broadcast) 实现大对象的单向高效分发,累加器(Accumulator) 实现跨任务的聚合计数。本文从底层机制、源码实现、最佳实践三个维度,配合 2 张原创深色架构图,彻底拆解 TorrentBroadcast 的 BitTorrent 分块分发机制和 Acc