Apache Iceberg 数据湖表格式中的核心术语

  1. Data Files (数据文件)
    定义:这是 Iceberg 表中实际存储业务数据的文件。
    位置:通常位于表的数据存储目录下的 data目录中。
    格式:常见的格式是 Parquet(以 .parquet结尾),例如图片中的例子 00000-0-root_..._0025-00001.parquet。
    特性:每次对表进行更新(如插入、删除、修改)操作,都会产生新的数据文件。
  2. Snapshot (表快照)
    定义:快照代表了表在某个特定时刻的完整状态。
    内容:每个快照包含一个清单列表(Manifest List),这个清单列出了当时表所包含的所有数据文件(Data Files)。
    作用:就像是数据库在某个时间点的备份视图,查询引擎可以通过快照确定要读取哪些数据文件。
  3. Manifest List (清单列表)
    定义:这是一个元数据文件,它列出了构建当前快照(Snapshot)所需的所有清单文件(Manifest File)。
    存储内容:
    每个 Manifest File 的路径。
    每个 Manifest File 存储的数据文件的分区范围。
    增加或删除了多少个数据文件等信息。
    作用:在查询时,它可以帮助快速过滤掉不需要扫描的文件,从而加速查询。
  4. Manifest File (清单文件)
    定义:这也是一个元数据文件,它列出了组成快照(Snapshot)的具体数据文件(Data Files)的详细信息。
    存储内容(每行描述一个数据文件):
    数据文件的状态(新增、删除等)。
    文件路径。
    分区信息。
    列级别的统计信息(如每列的最大值、最小值、空值数等)------这是 Iceberg 高效剪枝(Pruning)的关键。
    文件大小和行数。
    格式:通常以 Avro 格式存储(以 .avro结尾),例如图片中的例子 8138fce4-40f7-41d7-82a5-922274d2abba-m0.avro。
    作用:查询引擎在扫描表时,会利用这里的列统计信息跳过不相关的数据文件(例如,查询条件要求年龄>30,而某文件统计显示年龄最大值25,则该文件可直接跳过)。
    总结关系链
    这四个术语构成了一个自下而上的层级结构,用于管理表的版本和数据:
    Data Files (数据文件) →被记录在 Manifest File (清单文件) 中 →多个 Manifest File 被记录在 Manifest List (清单列表) 中 →最终构成 Snapshot (表快照)。
相关推荐
问商十三载9 小时前
AI引擎生成式优化实践:刑事辩护律师团队IP构建
大数据·人工智能
会议咨询10 小时前
2026年大数据、信息系统与智能通信国际会议(BDIIC 2026)
大数据·信息系统·智能通信
Raas10010 小时前
MAI Gateway(魔芋企业级AI网关)能力解析:AI网关能做故障转移吗?AI网关核心功能详解
大数据·人工智能·网关·ai·gateway·mai gateway
IT研究所11 小时前
AI-ITR平台如何减少客户问题反复升级?
大数据·运维·人工智能·低代码·自然语言处理·安全架构·企微
回眸&啤酒鸭11 小时前
【回眸】OpenSwarm 多智能体协作系统实战指南
大数据·前端·人工智能
大大大大晴天12 小时前
每天认识一个组件:Apache DolphinScheduler
大数据
yumgpkpm12 小时前
Acceldata ODP(Open Data Platform)3.3.6.4(RHEL9)保姆级完整安装手册
大数据·人工智能·hive·hadoop·kafka·hbase·cloudera
邓工说电12 小时前
智慧断路器安全吗?数据加密、离线保护与合规认证全解读
大数据·数据库·人工智能·智能断路器·炜晔科技
出海客12 小时前
跨境电商多语言客服知识库怎么建:资料结构、检索边界与人工升级
大数据·人工智能
liliangcsdn12 小时前
派息率指标的应用探索和分析
大数据·算法