为什么 JSON 正在成为分析数据库新的竞争点?

摘要: JSON 正从辅助数据变成核心工作负载,推动分析数据库能力边界变化。当数据混合了关系型、JSON、日志、文本与向量,竞争标准已从"谁查询结构化表更快"转向"谁能更自然地处理不断变化的数据"。文中半结构化性能引用 JSONBench 公开基准。

过去讨论分析数据库,大家最关注的通常是 Join、聚合、并发和查询性能。但这几年,一个过去并不算核心的数据类型正在快速改变分析数据库的能力边界:JSON

原因很直接。企业里的数据越来越不像传统数据仓库里的规则表格,日志、埋点、OpenTelemetry、IoT、事件流、API 返回结果,甚至很多 AI 应用产生的数据,都带有大量动态字段和半结构化内容。Schema 不再稳定,字段会持续增加,数据结构也会不断变化。

如果数据库仍然只擅长处理固定 Schema 的结构化表,那么很多数据在进入分析系统之前,就必须先经历复杂的数据清洗和建模。JSON 的价值因此不只是"省掉建表",而是让数据平台能够先接住不断变化的数据,再在后续查询中完成理解和分析。

"支持 JSON"和"擅长 JSON"是两回事

几乎所有现代数据库都可以保存 JSON,但"能存"与"适合生产分析"完全是两回事。

真正会拉开差距的是:动态字段是否需要提前定义,查询时是否需要反复解析,是否支持对动态字段建立索引,半结构化数据能否和普通列一起参与 SQL 分析,以及全文检索能否和结构化条件组合。

所以,真正有意义的问题已经不是"数据库支不支持 JSON",而是:

数据库能不能把 JSON 当作一等公民来处理?

Doris 和 StarRocks 的差异,正好能说明这种变化

Apache Doris 和 StarRocks 都是成熟的实时分析数据库,在结构化数据场景下都有完整的 OLAP 能力。如果业务主要处理订单、商品、用户等固定 Schema 数据,两者都能够很好地承担分析查询。

但当工作负载转向大量 JSON、日志和动态字段后,两者的产品能力开始出现更明显的分化。

Apache Doris 当前提供 Variant 类型,并支持倒排索引、IK、ICU 和自定义分词等能力,使半结构化数据不仅能被存储,也能继续参与过滤、检索和分析。 StarRocks 同样具备倒排索引等能力,但从现有材料看,在 Variant 类型、分词器支持和可观测生态覆盖上相对有限。

这里真正的差异,不是"一个支持 JSON、一个不支持",而是当 JSON 从辅助数据变成核心工作负载后,数据库是否形成了一套完整的半结构化数据处理体系。

日志场景会把这种差异进一步放大

日志其实是最典型的 JSON 工作负载。它通常字段多、Schema 经常变化、文本内容多,而且写入持续发生。查询时又往往既有结构化过滤,也有全文检索。

例如,用户可能先按照 service=paymentregion=cn 筛选,再搜索 timeout 或某段错误信息,最后根据 trace_id 继续定位问题。这已经不是单纯的 SQL Analytics,而是结构化分析、半结构化查询和 Search 的结合。

也正因为如此,JSON 能力开始直接影响分析数据库能不能进入日志和可观测场景。Doris 已经提供 Logstash、Filebeat、OpenTelemetry、Fluent Bit、Kibana、Langfuse 等生态集成,并把日志、Trace、Metric作为明确的产品场景。

性能差异开始从结构化查询扩展到半结构化查询

JSON 查询本身也比传统固定 Schema 数据更复杂。数据库不仅要读取数据,还需要处理动态字段、类型判断、嵌套结构和索引。

材料引用的 JSONBench Hot Run 中,Apache Doris 的结果为 ×4.09,StarRocks 为 ×9.17,Doris 在这一测试中的半结构化数据分析性能约为 StarRocks 的两倍。

这组数据更适合作为一个辅助信号:当工作负载从标准结构化 OLAP 转向 JSON 后,数据库在存储模型、索引和执行层面的差异,会更加明显地反映到实际性能上。

JSON 背后,其实是数据库边界的变化

如果企业只处理传统数仓数据,那么把 SQL 做快就足够了。但今天的数据越来越混合,关系型数据、JSON、日志、文本甚至向量开始出现在同一条业务链路里。

企业也越来越不希望为了不同数据形态分别维护多套系统。于是分析数据库的竞争标准开始变化:不只是"谁查询结构化表更快",而是"谁能更自然地处理真实世界里不断变化的数据"。

从这个角度看,JSON 并不是一个孤立的 Feature。它连接的是日志、可观测、Search,以及之后可能继续扩展的 AI 工作负载。

对于正在评估 Doris、StarRocks 或其他实时分析数据库的团队来说,真正值得测试的,也已经不只是"能不能写入 JSON",而是:动态数据持续增长以后,这套系统还能不能高效地查询、检索和分析。

落到生产环境

当 JSON 与半结构化数据从辅助字段变成核心生产负载,团队往往还需要云托管、企业级部署、SLA 保障与商业支持。SelectDB 是基于 Apache Doris 构建的商业产品,提供云数仓与企业级服务,可在同一技术底座上获得生产级支持,无需脱离 Doris 生态即可满足企业落地需求。

参考来源

相关推荐
机械改造鹅26 分钟前
从零开始拆解Pi系列——(7)Extension API
agent
ClouGence1 小时前
开源数据库管理工具 CloudDM 4.2.0 发布,新增 GoldenDB、KingbaseES 等数据源
数据库·dba·devops
plainGeekDev1 小时前
Agent代码审查与批量修复流水线
agent·ai编程·claude
发霉的馒头1 小时前
ORA-00845: MEMORY_TARGET not supported on this system的解决方法
数据库
然我1 小时前
模型不是 Agent:从零实现一个最小 Agent Loop
前端·人工智能·agent
深蓝AI2 小时前
Mem0 实战:给 AI 应用加上长期记忆,从 Hello World 到生产用法
agent
AI效率君2 小时前
Deer‑Flow 2.0 + Go‑MCP‑Server(add加法工具)保姆级完整教程
人工智能·agent
昭昭日月明2 小时前
LangChain 生态:从链到代理,开发者需要掌握的三大核心
python·langchain·agent