
中国版Databricks的叙事不是一个概念的炒作,而是理解OceanBase业务逻辑和资本估值的一个标尺。
文|游勇 周享玥
编|周路平
上周,AI数据平台厂商Databricks刚刚完成了新一轮50亿美元融资,估值冲到了1900亿美元。
业内在为其成长速度感到惊讶的同时,Databricks也给全球数据库厂商建立了一套新的价值坐标体系------企业AI的落地,不再满足于一套"存得了数据、查得到记录"的数据系统,而是迫切需要一套为Agent负载而设计的AI数据底座。
越来越多的企业发现,大模型之间的技术差距正在快速收窄,数据的价值被放大。大模型厂商Anthropic曾在内部业务中做过分析评测,同一版Claude模型,直接对接原始数仓时准确率仅21%;接入完整数据工程体系后跃升至95%以上。AI落地的差距不在模型,而在模型背后的数据底座。
海内外的数据库厂商都在为支撑Agent的负载推出全新的产品。而在国内,以OceanBase为代表的厂商,已经率先完成了技术架构的升级,发布湖库一体AI数据库及AI数据平台产品,推动其从分布式数据库领导者的角色向全球领先的AI数据平台进化。
**彭博在报道中将OceanBase称为"中国的Databricks",两家厂商被放在了同一个竞争坐标中审视。**但两家企业在实现路径上又呈现出明显的差异:一个从数据库出发,向数据湖延伸;一个从数据湖启程,向数据库延伸。路径迥异,却殊途同归,共同指向了AI时代对数据基础设施的重构。
01
从人到 Agent,数据底座为何要变?
想象一个场景:你的AI Agent正在处理一笔实时交易------查询账户余额、调取客户行为记录、检索合同风险条款,然后做出审批决定。这三个查询分别指向三个不同系统:事务数据库、数据仓库和文档存储。数据在不同系统间复制、转换、同步,等Agent拿到所有信息时,账户余额已经是两秒前的状态。两秒,对人不过弹指一瞬。但对Agent,意味着决策依据已经失效,两秒足以酿成交易失败或风控漏洞。
问题出在哪里?并非模型不够聪明,而是支撑这个决策的数据,分散在彼此割裂的旧架构里,根本来不及在决策发生的那一刻全部到位。这正是过去几年AI落地企业"最后一公里"的本质难题:通用模型和企业所需的智能之间,横亘着巨大的业务上下文鸿沟,模型再聪明,读不懂业务、参与不了决策、跑不通流程,就无法创造价值。

市场数据也在印证这一点。Gartner预测,到2026年底,缺乏AI就绪数据支撑的AI项目中,60%会被企业放弃。Hitachi Vantara的报告则显示,中国仅39%的企业属于"数据成熟型",61%仍处于"数据滞后型"阶段。这种成熟度差距直接体现在投资回报上:数据成熟型企业中68%实现了可量化的AI投资回报,滞后型企业仅为50%。
种种迹象表明,数据基础设施已经从支撑业务的"后台系统",走向AI价值兑现的前台。但这种转变的背后至少面临四重结构性的挑战。
**一是数据库的使用者从人变成Agent。**传统的数据库系统为人而设计,人查询有限,容忍延迟,在相对特定的时间工作。而Agent像一台"永动机",以机器速度全天候持续查询,并期望一次访问同时获得结构化事实、非结构化上下文及数据关系。Gartner预测,到2028年,超三分之一的企业软件交付将由Agent完成。这些"硅基员工"不休息、不等候、不妥协,对数据底座的弹性、隔离性和成本模型提出了前所未有的要求。
OceanBase CTO杨传辉在近期一场与Forrester首席分析师的对话中点破本质:过去分析采用T+1批处理模式之所以成立,是因为人通常周期性阅读报表。但Agent不会等待下一份报表,它在业务事件发生的瞬间提问并立即行动。"实时"不再是锦上添花,而是成了底线要求。
**二是Agent带来的规模问题变得突出。**过去业内比较的是"单一数据库能承载多大体量",AI时代要面对的却是"海量小表"------每个应用的数据很小,甚至大部分处于休眠状态,却需要随时实现秒级响应。
比如蚂蚁灵光承载了约 3000 万个闪应用,这些闪应用就是一个个由用户创建的Agent。它们不是数据库实例,每个Agent可能是有几百行代码,但其特点是数量庞大、Schema动态生成、彼此需要隔离,并且要在用户再次调用Agent时继续提供数据服务。
**三是数据结构发生了变化,非结构化数据成为"一等公民"。**过去,数据库系统主要为结构化数据服务,文本、图像、音视频、向量、JSON等非结构化数据因机器无法深度理解而长期被排除在管理半径之外,沉睡在成本中心。大模型第一次让它们变得"可计算",从"边角料"跃升为企业核心资产。IDC预测,到2029年,全球非结构化数据占比将超过80%。若其不能与结构化经营数据在同一底座上统一管理、治理和调用,Agent永远是在"盲人摸象"。
**四是Agent的工作负载从事务和分析,扩展到搜索、上下文工程与AI应用。**AI数据库要解决的不是"数据如何存储存",而是"Agent 如何安全、准确并持续地使用数据"。这些新型负载不再遵循固定的查询模式,而是随Agent的决策路径动态变化,对数据底座的并发弹性、混合负载隔离和一致性保障提出了全新要求。
"当Agent需要读取、写入、搜索、实验、回滚并持续构建上下文时,数据库还该保持原样吗?答案是否定的。"杨传辉观察到,越来越多CIO/CTO正在重建数据平台,动力并非追逐AI热潮,而是基于一个朴素认知------过去的分析技术栈并非为Agent这种新的数据使用者设计。"我们的任务不只是让旧平台运行得更快,还要重新思考AI数据平台应该是什么样子。 "杨传辉说。
02
融合成为主流,
OceanBase与Databricks的殊途同归
过去,企业技术栈有明确分工:数据库负责交易,数仓和数据湖负责分析,搜索引擎与向量数据库负责信息检索,模型平台负责训练和推理。这也造成了传统数据架构的一大痛点,同一份数据需要不断在不同系统之间复制、同步和转换,每个系统都有独立的管道、权限和一致性节奏。
这种架构在以前有其合理性。企业以结构化数据为主,应用按照预设流程运行,比如报表按天刷新,应用按写死的流程运行,各系统之间只要靠批处理管道对齐。
但AI时代,结构性矛盾开始凸显。一是数据搬运的成本浪费,传统ETL模式下,约30%的存算资源浪费在搬运和中间落地上;二是Agent工作的环境需要处理大量非结构化数据,比如历史文档、图片、音视频、向量等,而传统的数据库系统更多是为结构化数据而设计,非结构化数据被排除在了管理半径之外。三是实时决策的数据新鲜度不够。传统的数据分析通常按照预定周期进行处理,但Agent会在业务事件发生的那一刻提出问题,并立即根据答案采取行动。
"一份晚了三秒的数据副本就可能已经不准确。"Forrester 首席分析师Indranil Bandyopadhyay说,Agent如果基于错误的数据副本行动,带来的可能不是效率提升,而是业务风险。这在企业场景中显然是无法接受的。
数据库与AI的融合已经成为行业的共识,目标也非常一致:搭建一套面向AI时代的数据基础设施平台,打破数据库、数据湖、分析、搜索和AI之间的边界,让不同工作负载围绕统一的数据体系协同运行。
6月29日,OceanBase发布了湖库一体的AI数据库,本质上是把库里的实时事务能力、湖上的开放存储和开放计算能力,放到同一个数据底座上。

它不是简单地给湖仓补充在线查询接口,而是以统一存储、开放计算重构数据处理方式。存储层采用存算分离设计,通过 S3 兼容对象存储、Iceberg 开放表格式和多模表,将结构化字段、JSON、文档、图片、音视频及向量等数据纳入统一的数据与元数据体系;计算层除 SQL 外,还可对接 Spark、Daft on Ray 等开放计算引擎,分别支撑批量加工和多模态 AI 处理,让不同工作负载围绕同一份数据协同运行。
这套现代方案的优势在于,既发挥了数据湖在开放、弹性和成本的优势,又能发挥数据库在事务、一致性、低延迟和治理上的价值。
更重要的是,由于交易数据和分析数据存放在同一系统,Agent读取的是实时数据,而不是之前生成的数据副本,"这种能力很难在架构完成之后再补上"。而这对于Agent在企业场景的落地尤为关键。
**Databricks则代表了过去十年数据平台的另一条典型路线。**Databricks并非传统意义上的数据库厂商,它从计算引擎Spark出发,推出云端大数据分析产品,到2020年推出了湖仓一体架构(Lakehouse),将数据湖的灵活性和数据仓库的高性能深度融合,奠定了其行业地位。后来通过资本并购,在2025年推出了Lakebase,补齐了在线事务能力,支持Postgres接口直接将数据写入Lakehouse存储空间,并使Spark、Databricks SQL等其他分析工具能够立即对这些数据进行查询,而无需进行任何ETL处理。
2026年7月,Databricks又进一步提出LTAP的概念,尝试在存储层统一事务与分析数据,宣称 "一套数据,零妥协,零副本"。
不难发现,Databricks选择的是在存储层统一数据,试图让湖获得实时事务能力。而OceanBase首先在数据库内实现事务与实时分析一体化,再通过Lakebase连接对象存储和开放计算,试图让实时业务数据直接服务分析与AI。
但两条路线并不没有优劣之分。Databricks本身拥有成熟的数据工程和AI开发生态;而OceanBase的独特性,则来自关键交易、实时分析和生产级数据库能力。
OceanBase的技术起点不是数据湖,而是关键交易和实时业务数据。当年,OceanBase从原生分布式数据库出发,承受住了互联网和金融业务的极限场景考验,解决了生产系统不能停、数据不能错、业务规模持续增长的问题。后来,OceanBase通过HTAP让事务处理与实时分析运行在同一份业务数据上,分析查询不必等待数据进入另一套系统。
如今,OceanBase通过推出湖库一体AI数据库,将能力进一步延伸至开放存储、多模态数据、混合搜索和AI计算,让模型和Agent拥有实时、完整、可信的业务上下文。OceanBase从最坚固的交易底座一路向上,长出分析和AI能力。
**"有些厂商从Lake出发,现在正在增加数据库能力。Databricks今年做的就是这件事情。而我们OceanBase是从数据库出发,再加入Lake。不同的道路,但最终目的地是一样的。"**杨传辉说。
这句话不仅准确概括了OceanBase与Databricks的技术差异,背后其实也将二者放在了全球AI数据平台公司的竞争坐标系中。虽然起点不同,技术路线也不同,但双方都在指向更加统一的AI数据平台。
如今,OceanBase已经推出了Lakebase、DataStudio和DataPilot完整AI数据平台的产品体系。其中,Lakebase提供湖库一体、多模态数据处理、混合搜索以及开放存储与计算能力;DataStudio覆盖数据接入、加工、任务编排、语义建模、治理和服务;而DataPilot面向经营分析与业务决策,让业务人员通过自然语言使用企业数据。
这意味着OceanBase的能力边界正在从数据库内核,延伸至数据生产、治理、服务和业务使用,并已经具备构成AI数据平台的关键产品与技术能力。
03
中国版Databricks背后,
是一场数据库的价值升维
Databricks的估值从1000亿美元涨到1900亿美元,中间只花了11个月。资本追捧并非简单的市场情绪的偶然碰撞,而是有实打实的业务增长在支撑。2026年8月,Databricks披露的年化营收运行率突破了70亿美元,其中AI产品的年化运行率达17亿美元,占总收入约25%,且是其中增长最快的部分,而三年前这个数字是零。
但更引人瞩目的是,Databricks专为Agent工作负载打造的数据库Lakebase,上线仅8个月,收入便是同期Databricks SQL(成熟产品)的2倍,而且首年ARR破1亿美元,这也成为企业软件史上成长最快的产品。

这意味着,AI在企业场景的加速落地,正在推动AI数据基础设施的需求井喷。Databricks为Agent打造一个数据平台的叙事,精准切中了企业用户的需求。
而这背后,Databricks也在给所有数据库厂商带来了全新的价值叙事。
传统数据库的商业模式是按License和实例用量收费,天花板清晰可见。而以Databricks为代表的AI数据平台则是在按Agent任务计费,按消费计费------数据存得越多、AI跑得越勤、Agent调用越频繁,平台收入自动放大。按座收费的天花板是客户的员工数,消费收费的天花板是客户的工作量。
正如Saastr观察:Figma、Atlassian、Snowflake、Databricks近一年集体加速增长,共性就是"消费定价 + AI工作负载"------旧的"规模越大增速越衰减"规律在这套模式下失效了。资本市场的定价不是Databricks今天有多大,而是它在AI数据基础设施层"不可替代性"的复利效应。
在传统IT架构中,数据库作为连接应用与硬件之间的中间层,其价值逻辑是"省成本",而不是直接创造收入。但当计算向数据迁移,数据所在的物理位置和平台就不再是后台设施,而成了基础设施设计的起点------存储不再是瓶颈,而是企业智能增长的引擎。AI数据基础设施正在从"支撑系统"变成 AI 价值链的卡位点和放大器。
但企业把AI用进生产环境,要的不只是智能,而是"不出错的智能"。Agent替代了人去使用数据库,这意味着数据库的可靠性和安全性提出了更高的要求,每一步动作由数据库兜底。这恰恰是OceanBase在数据库时代打磨出的核心能力。
OceanBase并不是AI时代横空出世的创业公司。过去十几年,这家诞生于内部业务需求的数据系统,从支撑双十一的海量洪峰到金融、政务场景的大规模行业应用,已经塑造了其最坚实的技术骨架和行业壁垒。
赛迪报告显示,OceanBase收入位列中国分布式数据库市场第一。IDC数据则显示,OceanBase已连续三年在中国金融行业分布式数据库本地部署市场份额排名第一,近七成万亿级资产规模的银行将核心系统搭载于OceanBase之上。
2026年7月,OceanBase进入Forrester多模数据平台评估并获评"卓越表现者",也说明其在多模型事务一致性、实时分析和企业级服务方面的能力,已经进入全球专业机构的观察范围。
当AI的需求井喷时,OceanBase过往的技术和行业积累,成为其走向AI数据平台的重要技术基础。正如OceanBase CEO杨冰所言,湖库一体的AI数据库并不是将过去的一切推倒重来,"真正被重写的,是架构与品类;必须被坚守的,是工程的底线。"
比如Agent读取的是账户余额、订单状态、风险规则和实时库存等核心数据,对数据的一致性和服务的可靠性要求非常高,AI并没有降低数据库的工程标准,反而让这些标准变得更加重要:一致性决定了Agent获得的业务状态是否可信;可靠性决定AI应用能否持续参与业务流程;实时性决定模型看到的是当前事实还是历史快照;扩展性决定平台能否支撑不断增加的应用和Agent。
尽管OceanBase与Databricks当前的收入规模不同,但作为同一赛道、不同起点的中国对标者,这种差距本身也说明市场还有很大的机会。更关键的是,OceanBase通过在AI数据产品和架构上的布局,完成了从"数据库公司"的旧坐标系到"AI数据平台公司"新坐标系的切换。
**中国版Databricks的叙事不是一个概念的炒作,而是理解OceanBase业务逻辑和资本估值的一个标尺。**它不再只是一家分布式数据库公司,也正在成为中国AI数据平台的重要力量。