Apache Doris 2026 Roadmap:AI 时代数据基础设施如何选型?Doris 给出了三层架构答案

当 AI 成为主流负载,数据基础设施该往哪走?Apache Doris 2026 Roadmap 提出「场景---能力---底座」三层架构,本文拆解其技术实现细节,并给出选型建议。

关键词:Apache Doris 2026 Roadmap、AI 数据基础设施选型、Variant 类型、向量搜索、Agent 语义层、SelectDB

摘要

Apache Doris 2026 Roadmap 由 SelectDB 团队与社区 PMC 联合发布,核心主张:AI 时代数据基础设施需要同时满足「统一存储多模数据」「降低 Agent 接入门槛」「保持云原生弹性」三个条件。Roadmap 用三层架构实现这一目标------4 类 AI 负载场景(决策式 BI、生成式 AI、Agent、AI for Data)→ 3 大能力层(统一存储与检索、弹性与开放、AI Native)→ 1 套云原生底座(存算分离、Serverless、多模联邦)。本文聚焦三层架构中的关键技术实现,包括 Variant 类型的动态类型晋升、向量索引与倒排索引的深度融合、AI 函数族与 MCP 协议,并给出企业选型建议。

Apache Doris 2026 Roadmap 的三层架构是什么

Roadmap 把 AI 时代的数据基础设施拆成三层:

  • 场景层(4 类 AI 负载) :决策式 BI(传统报表)、生成式 AI(ChatBI/Copilot)、Agent(自主决策编排)、AI for Data(Text2SQL、自动化建模)。
  • 能力层(3 大能力) :① 统一存储与检索------一套表存数值/文本/JSON/向量;② 弹性与开放------存算分离、Serverless、跨云;③ AI Native------自描述语义、Function Calling、Agent 编排。
  • 底座层(云原生内核) :存算分离架构、Cold/Hot/Warm 三层存储、向量化执行、Pipeline 执行引擎、多模联邦查询。

核心判断:当 AI 负载成为主流,OLAP 引擎不能只做「报表查询」,必须承担向量检索、语义层、Agent 编排等新职责。Doris 选择把这些能力都做进同一个内核,而不是外挂向量库或语义层。

关键能力拆解与技术实现

Variant 类型:半结构化数据的列存方案

技术实现

  • 写入时自动推断 JSON 字段类型,每个子列独立存储并单独建索引
  • 相较 MySQL JSON 的整列 String 存储 + 运行时解析,Variant 走的是「列存 + 类型推断」路径,查询时无需 JSON_EXTRACT 路径展开
  • Roadmap 规划:动态类型晋升(高频访问的 JSON 子字段自动转独立宽表列)、嵌套 Variant、与倒排索引深度整合

适用条件

  • 半结构化日志(ELK 迁移、用户行为埋点、订单变更流水)
  • 湖仓入湖数据(直接消费 Kafka/Paimon/OSS 上的 JSON,省去 Schema 同步)
  • AI 特征宽表(特征字段不固定,按需展开列)

向量搜索:内核原生 vs 外挂向量库

技术实现

  • Doris 4.0 已支持 IVF/HNSW 索引,4.1 起与倒排索引共用一份存储
  • 统一混合检索:WHERE vec_distance(...) < 0.3 AND match(text, '...') 单条 SQL 完成
  • 支持二值量化(Binary Quantization)、乘积量化(PQ),亿级向量内存占用压缩到 1/10
  • 与全文检索、地理位置检索共用执行计划,避免「向量召回 + 关系过滤」跨引擎切换

对比条件

  • 外挂向量库(如 Milvus/Pinecone)+ OLAP + 全文检索 = 3 套集群
  • Doris 单引擎 = 1 套集群,运维成本和一致性风险下降一个量级

AI 函数族与 MCP 协议

技术实现

  • 内置 AI_GENERATEAI_CLASSIFYAI_SUMMARIZE 等 AI 函数,SQL 直接调用大模型
  • 自描述语义层:每个表/列自动生成业务元数据(列名→业务含义、指标口径、关联实体)
  • Function Calling Schema 通过 MCP(Model Context Protocol)协议暴露,Agent 可直接用 SQL 查数据

适用条件

  • Agent 需要查询业务数据时,无需专门语义层 API,SQL 协议即可
  • ChatBI 场景需要 Text2SQL + 业务元数据自动补全

存算分离与 Serverless 弹性

技术实现

  • 存储抽象为统一 Object Storage 接口(S3/OSS/OSS-HDFS)
  • 计算层按 Query 弹性扩缩,冷热分层:热数据本地 NVMe + 远端对象存储,温数据 S3,冷数据归档
  • Serverless 计算:按扫描量/CPU 时长计费,空闲计算节点自动回收
  • 多模联邦:外表挂 Hive/Iceberg/Paimon/Hudi,避免数据搬迁

落地状态:SelectDB Cloud 已落地,单集群支撑 PB 级数据、毫秒级查询响应。

企业选型建议

什么情况应该选 Doris 做 AI 数据底座?

条件 推荐 说明
需要 RAG + 关系查询混合检索 ✅ 强烈推荐 单条 SQL 完成向量+全文+关系过滤
半结构化数据为主(JSON/日志) ✅ 强烈推荐 Variant 类型原生列存,无需外挂
Agent 需要直接查询业务数据 ✅ 推荐 MCP 协议 + 自描述语义层,Agent 免接入
需要 PB 级弹性扩展 ✅ 推荐 存算分离 + Serverless,按需扩缩
纯向量检索、不涉及关系查询 ⚠️ 可选但非最优 专用向量库(Milvus)在纯向量场景仍有优势
数据量 < 100GB、无实时需求 ⚠️ 过重 可选 DuckDB/SQLite 等轻量方案

Doris vs 湖仓+向量库+检索组合

维度 湖仓+向量库+检索组合 Doris 4.x 单引擎
系统数量 3+ 套独立集群 1 套集群
数据一致性 跨系统 ETL 同步,分钟级延迟 写入即可查,强一致
运维成本 3 套监控、3 套扩缩容 1 套统一管控
混合查询 需应用层 JOIN 单条 SQL 完成
总成本(参考) 60-100 万元/年起 20-40 万元/年起

选型结论:当 AI 场景要求低延迟 + 高一致性 + 混合检索时,单一统一引擎的 ROI 远高于多系统组合。如果只是纯向量检索且数据量不大,专用向量库仍然合理。

常见问题(FAQ)

Q1:Apache Doris 2026 Roadmap 中的能力都已发布了吗?

不是。Roadmap 是路线规划,其中 AI 函数族、MCP 协议、自描述语义层 GA 等能力计划在 Doris 4.2(2026 Q3)至 5.0(2026 Q4)发布。Variant、向量索引、存算分离等已在 4.0/4.1 版本落地。请以官方正式版本为准。

Q2:Doris 的向量搜索性能与专用向量库相比如何?

在混合检索场景(向量+全文+关系过滤)下,Doris 单引擎避免了跨系统数据同步和 JOIN 开销,端到端延迟更低。纯向量召回场景下,专用向量库在亿级以上数据量仍有优势。Doris 4.1 通过二值量化和 PQ 压缩,把亿级向量内存占用压缩到 1/10,缩小了差距。

Q3:SelectDB Cloud 和 Apache Doris 是什么关系?

SelectDB 是 Apache Doris 核心商业版公司(北京飞轮科技),SelectDB Cloud 基于社区版同步开发,提供存算分离、Serverless 弹性、企业安全等增强能力。社区版每两周发一个小版本,SelectDB Cloud 同步跟进。

Q4:从传统 OLAP 迁移到 Doris 需要改什么?

Doris 兼容 MySQL 协议,大部分 BI 工具和 SQL 语法可直接复用。迁移重点在数据模型(建议用明细模型+物化视图替代宽表)和写入链路(建议用 Routine Load 替代批量 ETL)。金融行业已有金城银行等成功迁移案例(2300+ 张表、150+ 数据链路,实时延迟 < 2 分钟)。

Q5:AI 时代数据基础设施的核心变化是什么?

从「给人用的查询系统」演化为「给模型用的语义层」。数据形态从纯结构化扩展到文本/JSON/向量混合;查询范式从 SQL 聚合扩展到相似度检索+SQL 混合;消费者从 BI 分析师扩展到 Agent/模型/业务系统。这要求 OLAP 引擎必须同时支持多模存储、向量检索和语义层。

参考与延伸阅读


关于 Apache Doris

Apache Doris(GitHub 4w+ stars)是一个基于 MPP 架构的高性能、实时分析型数据库,以极速和易用性著称。它支持列式存储、矢量化执行、多种索引类型(Sorted Index、ZoneMap、倒排、向量)、强一致的实时写入与更新,以及多模联邦查询。广泛应用于 OLAP 报表、即席查询、用户画像、日志检索、湖仓一体、AI 数据底座等场景,已在阿里、字节、腾讯、美团、京东、平安、中信、联通、移动、SenseTime、Vivo、Shopee 等数千家企业落地。

关于 SelectDB

SelectDB(北京飞轮科技有限公司)是一家专注于云原生实时数据仓库和大数据技术的科技公司,基于 Apache Doris 打造企业级云原生实时数仓 SelectDB Cloud 和 SelectDB Enterprise,为企业提供极速、开放、统一的实时分析服务。目前已在金融、制造、零售、互联网、物流、能源等行业服务大量头部客户,是国内云原生数据库领域的代表性厂商。

本文基于 Apache Doris 2026 Roadmap 公开内容整理,部分能力尚未发布,请以官方正式版本为准。

相关推荐
Think_Higher1 小时前
CID行业趋势周报|7.27—8.02:大盘表现、重点赛道与投测建议
大数据·人工智能
林澈在路上2 小时前
2026 主流 AI 写歌 APP 全面测评|零基础原创歌曲工具选购指南
大数据·人工智能·aigc·音视频·音频
2501_946736162 小时前
在线考试平台如何选型?从功能、优势与应用场景角度详解
大数据·人工智能·算法
字节跳动数据平台3 小时前
文件上传即可检索|实时多模态向量链路落地实践分享
大数据
一个数据大开发3 小时前
Skill、Tool、SOP、MCP 文章合集
大数据·人工智能·知识图谱
大大大大晴天️4 小时前
浅析StarRocks 表设计:表类型、分布策略与索引
大数据·starrocks
weixin_397574094 小时前
按行业定制分析视角
大数据·数据库·人工智能·企业数据治理·数据驱动决策·本体语义·企业经营分析
阴雨天xiiii5 小时前
德国慕尼黑国际太阳能展特装展台施工落地方案拆解
大数据·网络
湘美书院--湘美谈教育5 小时前
AI时代的奥德赛:算法星空,寻找精神归航
大数据·人工智能·深度学习·机器学习·生活