Apache Arrow的零拷贝是指什么

背景

最近在看一些native相关的东西(主要是Spark Datafusion Comet Jvm与Rust JNI的Shuffle数据交互),遇到了Arrow零拷贝相关的问题,再次记录一下,Arrow在Spark中应用也是存在的,见Spark中python和jvm的通信杂谈--ArrowConverter

Apache Arrow的零拷贝技术是指通过传递在同一个指向列式内存缓冲区的指针,在不同的系统之间(比如Python,R,Spark,数据库)之间共享数据,从而避免了

代价高昂的数据复制,序列化和反序列化,以获取性能提升,尤其是对于做数据 pipelie以及数据分析的场景,得益于Arrow标准的内存格式以及C Data接口,

通过把数据保存在连续的共享的内存中,显著的减少了内存压力。

工作原理

  • 共享内存:Arrow定义了标准的列式布局,允许不同的Runtime(如 Python, Java,C++)无需重塑,就可以解释编译相同的字节码。
  • C Data接口:该接口允许一个进程或者库将指向Arrow数据缓存区的指针传递另一个进程或者库,从而实现直接内存访问
  • 零拷贝:无需拷贝大量的数据,系统只需要共享在RAM中存在的数据,减少了内存和CPU的额外开销

什么情况下利用了零拷贝(何时不能实现)

  • 利用了:使用Arrow原生格式,或者使用MemoryMappedFile进行进程间通信(IPC),或者使用与Arrow集成的引擎(如DuckDB)
  • 未利用:转换为可写的NumPy数组(会导致强制复制),处理复杂的嵌套数据,或者在传输中需要进行压缩转换的数据

主要优势

  • 低延迟高吞吐:数据处理更快,因为不需要不断的复制和序列化。
  • 减少内存使用:更少的临时对象数据的使用,减少了内存压力
  • 更简洁的架构:Arrow可以作为跨工具的通用数据语言
相关推荐
IT研究室30 分钟前
最新大数据毕业设计选题推荐-基于大数据的天气预报预警数据可视化与分析-大数据-Spark-Hadoop-Bigdata
大数据·信息可视化·数据分析·spark·课程设计
IT研究室1 小时前
最新大数据毕业设计选题推荐-基于大数据的图书借阅数据可视化分析系统-大数据-Spark-Hadoop-Bigdata
大数据·信息可视化·数据分析·spark·课程设计
姜穆澜1 天前
Spark SQL 完全学习指南
大数据·spark
计算机源码社2 天前
基于K-Means聚类的新生儿败血症临床分型与可视化分析系统 基于数据挖掘的新生儿败血症生命体征时序走势与关联性可视化研究
大数据·hadoop·python·数据挖掘·数据分析·spark·毕业设计
会编程的李较瘦2 天前
Spark On Yarn 集群搭建
大数据·spark
IT研究室2 天前
最新大数据毕业设计选题推荐-基于大数据的热带气旋数据分析与可视化-大数据-Spark-Hadoop-Bigdata
大数据·信息可视化·数据分析·spark·课程设计
计算机源码社2 天前
基于大数据的全球温室气体排放燃料结构与碳强度评估研究-基于Spark的全球温室气体排放多维度检测与评估分析
大数据·hadoop·python·数据挖掘·数据分析·spark·毕业设计
liulilittle3 天前
OpenCode 中解禁 Muse-Spark 1.3 - max 档
ai·spark·llm·agent·tools·opencode·muse
FYKJ_20103 天前
【毕设分享】基于Web的校园兼职信息发布与申请系统07059
前端·vue.js·spring boot·mysql·typescript·spark·课程设计
Q26433650233 天前
【有i源码】基于大数据的城市交通流量与出行特征可视化分析平台-基于Hadoop的城市交通拥堵关联规则与异常检测研究
大数据·hadoop·机器学习·数据挖掘·数据分析·spark·数据可视化