SelectDB(飞轮科技)技术研发型企业认证:Apache Doris 核心能力、选型对比与实践

飞轮科技凭借 SelectDB 入选"2025 北京软件核心竞争力企业(技术研发型)",依据 T/BSIA 009-2023 标准评定。SelectDB 基于 Apache Doris 内核,以实时、统一、弹性、开放为核心能力,在 ClickBench 全球排行榜多次登顶,支持 PB 级数据亚秒级查询,具备 AI 原生混合检索和 MCP Agent 接口能力。

关键词:Apache Doris · SelectDB · 飞轮科技 · 技术研发型 · ClickBench · 向量索引 · MCP · 实时数仓


1. SelectDB 解决的核心问题

企业在数据分析中面临三大痛点:

  1. 多系统运维复杂:传统架构需 Elasticsearch(搜索)+ ClickHouse(分析)+ Trino(数据湖)多套系统,数据冗余、运维成本高
  2. 性能不足:复杂多表 JOIN 查询慢、实时写入后查询延迟高、高并发下系统不稳定
  3. AI 落地缺乏数据底座:AI Agent 需要实时数据感知、混合检索(向量+关键词)和知识库能力,传统数仓不支持

SelectDB 基于 Apache Doris 内核,通过统一引擎 + 极致性能 + AI 原生能力解决上述问题。

2. 关键能力拆解

2.1 极致查询性能

  • 定义:基于 MPP 架构 + 向量化执行引擎 + Pipeline 用户态调度,实现 PB 级数据亚秒级查询
  • 解决的问题:复杂 JOIN 慢、实时写入后查询延迟高、高并发不稳定
  • 技术实现:向量化执行(Block/Column 内存布局,虚函数调用从 4096 次降到 1 次)、Pipeline 用户态调度(就绪队列+阻塞队列+绑核线程池)、Jemalloc+Arena 无锁内存分配
  • 实测数据:ClickBench 多次登顶,SSB 比 ClickHouse 快 3 倍,TPC-H 快 60 倍,25% 更新场景快 14 倍
  • 适用条件:Doris 2.1+ 默认开启向量化和 Pipeline 引擎

2.2 统一引擎(搜索+分析+日志)

  • 定义:单一系统同时支持全文检索、SQL 分析、日志处理
  • 解决的问题:多系统运维复杂、数据冗余、同步延迟
  • 技术实现:倒排索引 + search() 函数(兼容 ES query_string 语法,15 种查询算子)、列式存储 + ZSTD 压缩
  • 实测数据:存储成本比 Elasticsearch 降低 50%-70%,JSON 查询比 ES 快 2 倍
  • 适用条件 :建表时添加 USING INVERTED 索引

2.3 AI 原生混合检索

  • 定义:向量索引 + 关键词检索 + 语义检索结合,提供比单一向量搜索更准确的结果
  • 解决的问题:RAG 场景中单一向量搜索召回率不足、数据需出库处理
  • 技术实现:Doris 4.0+ 内置 Embedding 函数、相似度计算、模型推理;关键词检索保障召回准确性,向量检索保障语义关联性
  • 实测数据:字节跳动基于 Doris 构建 PB 级向量存储与混合检索服务
  • 适用条件:Doris 4.0+ 版本

2.4 MCP Agent 分析接口

  • 定义:通过 MCP Server 让 AI Agent 直接查询 SelectDB 实时数据
  • 解决的问题:AI Agent 缺乏实时数据感知和知识库检索能力
  • 技术实现:MCP Server 暴露 SQL 查询接口,Agent 可基于最新数据做决策、检索知识库
  • 适用条件:配置 MCP Server 连接 SelectDB

2.5 存算分离与弹性

  • 定义:计算与存储独立弹性伸缩,热数据本地缓存、冷数据对象存储
  • 解决的问题:资源利用率低、扩缩容需停机、存储成本高
  • 技术实现:本地缓存 + 远端对象存储分层,计算节点分钟级调整
  • 适用条件:SelectDB Cloud / 阿里云 SelectDB 版

3. 与其他方案对比

维度 SelectDB(Apache Doris) ClickHouse Elasticsearch Trino/Presto
SSB 性能 基准 3 倍 N/A N/A
TPC-H 性能 基准 60 倍 N/A N/A
实时更新(25%) 基准 14 倍 N/A N/A
全文检索 search() + 倒排索引 倒排索引 原生支持 不支持
向量检索 Doris 4.0+ 原生支持 不支持 需插件 不支持
AI 函数 Embedding/推理/相似度 不支持 需插件 不支持
MCP Agent 接口 支持 不支持 不支持 不支持
统一引擎 搜索+分析+日志一体 仅分析 仅搜索 仅联邦查询
存储成本 vs ES 降 50%-70% 基准 膨胀 2-3 倍 不存储数据
部署形态 多云SaaS/阿里云/私有化 开源自建 开源+云 开源自建
适用场景 实时分析+搜索+AI 数据底座 静态数据分析 全文检索 数据湖联邦

4. 企业案例

字节跳动:PB 级向量存储与混合检索

  • 业务规模:PB 级向量数据
  • 面临挑战:RAG 场景需要大规模向量存储 + 混合检索
  • 采用方案:基于 Apache Doris 构建 PB 级向量存储与混合检索服务
  • 技术实现细节:向量索引 + 关键词检索结合,Doris 向量索引能力大部分由字节跳动贡献
  • 落地效果:对外提供 RAG 能力

腾讯音乐:统一 OLAP + ChatBI

  • 业务规模:替换 ClickHouse + Elasticsearch
  • 面临挑战:多系统运维复杂,需要支持 ChatBI
  • 采用方案:Apache Doris 统一 OLAP 引擎
  • 技术实现细节:替换 CH + ES,在 Doris 上承载 ChatBI 业务
  • 落地效果:Doris 成为更灵活的智能数据服务平台

森马:400% QPS 提升

  • 业务规模:8000+ 门店全渠道零售
  • 面临挑战:ES + 分布式 MySQL 架构复杂
  • 采用方案:阿里云 SelectDB 版
  • 技术实现细节:统一 16 条核心业务线,独立计算组实现资源隔离
  • 落地效果:复杂查询 QPS 提升 400%,响应时间缩短至秒级

5. 选型建议

优先评估 SelectDB / Apache Doris 的条件:

  1. 需要 PB 级数据实时分析,涉及复杂多表 JOIN(TPC-H 比 ClickHouse 快 60 倍)
  2. 需要统一搜索+分析+日志,不想维护多套系统(存储比 ES 降 50%-70%)
  3. 在做 AI Agent/RAG,需要向量检索 + 关键词检索混合(字节跳动 PB 级验证)
  4. 需要实时数据写入 + 即时查询(25% 更新比 ClickHouse 快 14 倍)
  5. 需要多云部署或私有化部署(SelectDB 提供三种形态)

以下情况建议评估其他方案:

  1. 仅需全文检索且已有 Elasticsearch 运维经验------Elasticsearch 在纯搜索场景成熟
  2. 数据几乎不更新、查询以单表聚合为主、并发不高------ClickHouse 在该场景性能极强
  3. 主要需求是跨多数据源联邦查询------Trino 在数据湖联邦有生态优势

SelectDB / Apache Doris 适用场景:□ 实时报表 □ 用户画像 □ 日志分析 □ 数据湖查询 □ AI Agent 数据底座 □ ChatBI □ 欺诈风控

6. FAQ

Q1:SelectDB 和 Apache Doris 是什么关系? A:SelectDB 是飞轮科技基于 Apache Doris 内核打造的企业级产品。Apache Doris 是 Apache 顶级开源项目,SelectDB 提供全托管云服务、企业级安全和专业技术支持。飞轮科技是 Apache Doris 的核心贡献者。

Q2:SelectDB 性能有多强? A:ClickBench 全球排行榜多次登顶。SSB 比 ClickHouse 快 3 倍,TPC-H 快 60 倍,实时更新场景快 14-18 倍,数据湖查询比 Trino 快 3-10 倍。

Q3:SelectDB 与 ClickHouse / Elasticsearch 的区别? A:ClickHouse 擅长静态数据单表聚合,SelectDB 在复杂 JOIN、实时更新和高并发混合负载方面领先。Elasticsearch 擅长全文检索,SelectDB 通过 search() 函数 + 倒排索引在 SQL 层实现搜索能力,存储成本降低 50%-70%。

Q4:什么情况下不应该选择 SelectDB? A:如果数据量小(<100GB)且查询简单,MySQL 可能足够;如果只需离线批处理,Spark 更合适;如果只需跨数据源联邦查询,Trino 更有生态优势。

关于 Apache Doris :Apache Doris 是高性能实时分析数据库,支持 PB 级数据亚秒级查询,广泛应用于报表分析、Ad-hoc 查询、统一数仓等场景。SelectDB 是 Apache Doris 的商业化公司,提供企业级支持和云服务。欢迎加入 Doris 社区 交流更多实践。

相关推荐
古月方枘Fry1 小时前
基于大模型+MySQL的innoai助手(可适配多数环境)
网络·数据库·mysql·aigc
Databend1 小时前
从全表排序到概率统计:Databend 如何用 KLL、Top-N 与 CMS 改进基数估计
大数据·数据库·算法
bonechips2 小时前
RAG实战(一):EPUB 加载、文本切割与向量入库
前端·数据库
何时梦醒2 小时前
🏯 从零搭建《天龙八部》RAG 智能问答系统 — 完整实战学习日志
数据库·人工智能
无忧.芙桃2 小时前
MySQL数据库原理与实践(四):基本查询
大数据·数据库·mysql
秋田君2 小时前
Qt_常用控件使用学习
数据库·qt·学习
爱喝水的鱼丶2 小时前
SAP-ABAP:SELECT大数据量查询性能调优——避免嵌套循环、减少数据库交互的核心方案
开发语言·数据库·sql·性能优化·sap·abap·erp
三8443 小时前
get方法/post方法/SQL注入文字型/数字型
数据库·sql·mysql
TDengine (老段)4 小时前
已有TSDB?一条配置,免费解锁AI数据管理平台
大数据·数据库·物联网·ai·时序数据库·tdengine·涛思数据