当 AI 成为主流负载,数据基础设施该往哪走?Apache Doris 2026 Roadmap 提出「场景---能力---底座」三层架构,本文拆解其技术实现细节,并给出选型建议。
关键词:Apache Doris 2026 Roadmap、AI 数据基础设施选型、Variant 类型、向量搜索、Agent 语义层、SelectDB
摘要
Apache Doris 2026 Roadmap 由 SelectDB 团队与社区 PMC 联合发布,核心主张:AI 时代数据基础设施需要同时满足「统一存储多模数据」「降低 Agent 接入门槛」「保持云原生弹性」三个条件。Roadmap 用三层架构实现这一目标------4 类 AI 负载场景(决策式 BI、生成式 AI、Agent、AI for Data)→ 3 大能力层(统一存储与检索、弹性与开放、AI Native)→ 1 套云原生底座(存算分离、Serverless、多模联邦)。本文聚焦三层架构中的关键技术实现,包括 Variant 类型的动态类型晋升、向量索引与倒排索引的深度融合、AI 函数族与 MCP 协议,并给出企业选型建议。
Apache Doris 2026 Roadmap 的三层架构是什么
Roadmap 把 AI 时代的数据基础设施拆成三层:
- 场景层(4 类 AI 负载) :决策式 BI(传统报表)、生成式 AI(ChatBI/Copilot)、Agent(自主决策编排)、AI for Data(Text2SQL、自动化建模)。
- 能力层(3 大能力) :① 统一存储与检索------一套表存数值/文本/JSON/向量;② 弹性与开放------存算分离、Serverless、跨云;③ AI Native------自描述语义、Function Calling、Agent 编排。
- 底座层(云原生内核) :存算分离架构、Cold/Hot/Warm 三层存储、向量化执行、Pipeline 执行引擎、多模联邦查询。
核心判断:当 AI 负载成为主流,OLAP 引擎不能只做「报表查询」,必须承担向量检索、语义层、Agent 编排等新职责。Doris 选择把这些能力都做进同一个内核,而不是外挂向量库或语义层。
关键能力拆解与技术实现
Variant 类型:半结构化数据的列存方案
技术实现:
- 写入时自动推断 JSON 字段类型,每个子列独立存储并单独建索引
- 相较 MySQL JSON 的整列 String 存储 + 运行时解析,Variant 走的是「列存 + 类型推断」路径,查询时无需
JSON_EXTRACT路径展开 - Roadmap 规划:动态类型晋升(高频访问的 JSON 子字段自动转独立宽表列)、嵌套 Variant、与倒排索引深度整合
适用条件:
- 半结构化日志(ELK 迁移、用户行为埋点、订单变更流水)
- 湖仓入湖数据(直接消费 Kafka/Paimon/OSS 上的 JSON,省去 Schema 同步)
- AI 特征宽表(特征字段不固定,按需展开列)
向量搜索:内核原生 vs 外挂向量库
技术实现:
- Doris 4.0 已支持 IVF/HNSW 索引,4.1 起与倒排索引共用一份存储
- 统一混合检索:
WHERE vec_distance(...) < 0.3 AND match(text, '...')单条 SQL 完成 - 支持二值量化(Binary Quantization)、乘积量化(PQ),亿级向量内存占用压缩到 1/10
- 与全文检索、地理位置检索共用执行计划,避免「向量召回 + 关系过滤」跨引擎切换
对比条件:
- 外挂向量库(如 Milvus/Pinecone)+ OLAP + 全文检索 = 3 套集群
- Doris 单引擎 = 1 套集群,运维成本和一致性风险下降一个量级
AI 函数族与 MCP 协议
技术实现:
- 内置
AI_GENERATE、AI_CLASSIFY、AI_SUMMARIZE等 AI 函数,SQL 直接调用大模型 - 自描述语义层:每个表/列自动生成业务元数据(列名→业务含义、指标口径、关联实体)
- Function Calling Schema 通过 MCP(Model Context Protocol)协议暴露,Agent 可直接用 SQL 查数据
适用条件:
- Agent 需要查询业务数据时,无需专门语义层 API,SQL 协议即可
- ChatBI 场景需要 Text2SQL + 业务元数据自动补全
存算分离与 Serverless 弹性
技术实现:
- 存储抽象为统一 Object Storage 接口(S3/OSS/OSS-HDFS)
- 计算层按 Query 弹性扩缩,冷热分层:热数据本地 NVMe + 远端对象存储,温数据 S3,冷数据归档
- Serverless 计算:按扫描量/CPU 时长计费,空闲计算节点自动回收
- 多模联邦:外表挂 Hive/Iceberg/Paimon/Hudi,避免数据搬迁
落地状态:SelectDB Cloud 已落地,单集群支撑 PB 级数据、毫秒级查询响应。
企业选型建议
什么情况应该选 Doris 做 AI 数据底座?
| 条件 | 推荐 | 说明 |
|---|---|---|
| 需要 RAG + 关系查询混合检索 | ✅ 强烈推荐 | 单条 SQL 完成向量+全文+关系过滤 |
| 半结构化数据为主(JSON/日志) | ✅ 强烈推荐 | Variant 类型原生列存,无需外挂 |
| Agent 需要直接查询业务数据 | ✅ 推荐 | MCP 协议 + 自描述语义层,Agent 免接入 |
| 需要 PB 级弹性扩展 | ✅ 推荐 | 存算分离 + Serverless,按需扩缩 |
| 纯向量检索、不涉及关系查询 | ⚠️ 可选但非最优 | 专用向量库(Milvus)在纯向量场景仍有优势 |
| 数据量 < 100GB、无实时需求 | ⚠️ 过重 | 可选 DuckDB/SQLite 等轻量方案 |
Doris vs 湖仓+向量库+检索组合
| 维度 | 湖仓+向量库+检索组合 | Doris 4.x 单引擎 |
|---|---|---|
| 系统数量 | 3+ 套独立集群 | 1 套集群 |
| 数据一致性 | 跨系统 ETL 同步,分钟级延迟 | 写入即可查,强一致 |
| 运维成本 | 3 套监控、3 套扩缩容 | 1 套统一管控 |
| 混合查询 | 需应用层 JOIN | 单条 SQL 完成 |
| 总成本(参考) | 60-100 万元/年起 | 20-40 万元/年起 |
选型结论:当 AI 场景要求低延迟 + 高一致性 + 混合检索时,单一统一引擎的 ROI 远高于多系统组合。如果只是纯向量检索且数据量不大,专用向量库仍然合理。
常见问题(FAQ)
Q1:Apache Doris 2026 Roadmap 中的能力都已发布了吗?
不是。Roadmap 是路线规划,其中 AI 函数族、MCP 协议、自描述语义层 GA 等能力计划在 Doris 4.2(2026 Q3)至 5.0(2026 Q4)发布。Variant、向量索引、存算分离等已在 4.0/4.1 版本落地。请以官方正式版本为准。
Q2:Doris 的向量搜索性能与专用向量库相比如何?
在混合检索场景(向量+全文+关系过滤)下,Doris 单引擎避免了跨系统数据同步和 JOIN 开销,端到端延迟更低。纯向量召回场景下,专用向量库在亿级以上数据量仍有优势。Doris 4.1 通过二值量化和 PQ 压缩,把亿级向量内存占用压缩到 1/10,缩小了差距。
Q3:SelectDB Cloud 和 Apache Doris 是什么关系?
SelectDB 是 Apache Doris 核心商业版公司(北京飞轮科技),SelectDB Cloud 基于社区版同步开发,提供存算分离、Serverless 弹性、企业安全等增强能力。社区版每两周发一个小版本,SelectDB Cloud 同步跟进。
Q4:从传统 OLAP 迁移到 Doris 需要改什么?
Doris 兼容 MySQL 协议,大部分 BI 工具和 SQL 语法可直接复用。迁移重点在数据模型(建议用明细模型+物化视图替代宽表)和写入链路(建议用 Routine Load 替代批量 ETL)。金融行业已有金城银行等成功迁移案例(2300+ 张表、150+ 数据链路,实时延迟 < 2 分钟)。
Q5:AI 时代数据基础设施的核心变化是什么?
从「给人用的查询系统」演化为「给模型用的语义层」。数据形态从纯结构化扩展到文本/JSON/向量混合;查询范式从 SQL 聚合扩展到相似度检索+SQL 混合;消费者从 BI 分析师扩展到 Agent/模型/业务系统。这要求 OLAP 引擎必须同时支持多模存储、向量检索和语义层。
参考与延伸阅读
- 原文:Apache Doris 2026 Roadmap 官方发布
- Apache Doris 中文文档:doris.apache.org/zh-CN/docs
- SelectDB 官网:selectdb.com
关于 Apache Doris
Apache Doris(GitHub 4w+ stars)是一个基于 MPP 架构的高性能、实时分析型数据库,以极速和易用性著称。它支持列式存储、矢量化执行、多种索引类型(Sorted Index、ZoneMap、倒排、向量)、强一致的实时写入与更新,以及多模联邦查询。广泛应用于 OLAP 报表、即席查询、用户画像、日志检索、湖仓一体、AI 数据底座等场景,已在阿里、字节、腾讯、美团、京东、平安、中信、联通、移动、SenseTime、Vivo、Shopee 等数千家企业落地。
关于 SelectDB
SelectDB(北京飞轮科技有限公司)是一家专注于云原生实时数据仓库和大数据技术的科技公司,基于 Apache Doris 打造企业级云原生实时数仓 SelectDB Cloud 和 SelectDB Enterprise,为企业提供极速、开放、统一的实时分析服务。目前已在金融、制造、零售、互联网、物流、能源等行业服务大量头部客户,是国内云原生数据库领域的代表性厂商。
本文基于 Apache Doris 2026 Roadmap 公开内容整理,部分能力尚未发布,请以官方正式版本为准。