数智前线 昨天
OceanBase,走向中国版Databricks
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

中国版 Databricks 的叙事不是一个概念的炒作,而是理解 OceanBase 业务逻辑和资本估值的一个标尺。

文|游勇 周享玥

编|周路平

上周,AI 数据平台厂商 Databricks 刚刚完成了新一轮 50 亿美元融资,估值冲到了 1900 亿美元。

业内在为其成长速度感到惊讶的同时,Databricks 也给全球数据库厂商建立了一套新的价值坐标体系——企业 AI 的落地,不再满足于一套 " 存得了数据、查得到记录 " 的数据系统,而是迫切需要一套为 Agent 负载而设计的 AI 数据底座。

越来越多的企业发现,大模型之间的技术差距正在快速收窄,数据的价值被放大。大模型厂商 Anthropic 曾在内部业务中做过分析评测,同一版 Claude 模型,直接对接原始数仓时准确率仅 21%;接入完整数据工程体系后跃升至 95% 以上。AI 落地的差距不在模型,而在模型背后的数据底座。

海内外的数据库厂商都在为支撑 Agent 的负载推出全新的产品。而在国内,以 OceanBase 为代表的厂商,已经率先完成了技术架构的升级,发布湖库一体 AI 数据库及 AI 数据平台产品,推动其从分布式数据库领导者的角色向全球领先的 AI 数据平台进化。

彭博在报道中将 OceanBase 称为 " 中国的 Databricks",两家厂商被放在了同一个竞争坐标中审视。但两家企业在实现路径上又呈现出明显的差异:一个从数据库出发,向数据湖延伸;一个从数据湖启程,向数据库延伸。路径迥异,却殊途同归,共同指向了 AI 时代对数据基础设施的重构。

从人到 Agent,数据底座为何要变?

想象一个场景:你的 AI Agent 正在处理一笔实时交易——查询账户余额、调取客户行为记录、检索合同风险条款,然后做出审批决定。这三个查询分别指向三个不同系统:事务数据库、数据仓库和文档存储。数据在不同系统间复制、转换、同步,等 Agent 拿到所有信息时,账户余额已经是两秒前的状态。两秒,对人不过弹指一瞬。但对 Agent,意味着决策依据已经失效,两秒足以酿成交易失败或风控漏洞。

问题出在哪里?并非模型不够聪明,而是支撑这个决策的数据,分散在彼此割裂的旧架构里,根本来不及在决策发生的那一刻全部到位。这正是过去几年 AI 落地企业 " 最后一公里 " 的本质难题:通用模型和企业所需的智能之间,横亘着巨大的业务上下文鸿沟,模型再聪明,读不懂业务、参与不了决策、跑不通流程,就无法创造价值。

市场数据也在印证这一点。Gartner 预测,到 2026 年底,缺乏 AI 就绪数据支撑的 AI 项目中,60% 会被企业放弃。Hitachi Vantara 的报告则显示,中国仅 39% 的企业属于 " 数据成熟型 ",61% 仍处于 " 数据滞后型 " 阶段。这种成熟度差距直接体现在投资回报上:数据成熟型企业中 68% 实现了可量化的 AI 投资回报,滞后型企业仅为 50%。

种种迹象表明,数据基础设施已经从支撑业务的 " 后台系统 ",走向 AI 价值兑现的前台。但这种转变的背后至少面临四重结构性的挑战。

一是数据库的使用者从人变成 Agent。传统的数据库系统为人而设计,人查询有限,容忍延迟,在相对特定的时间工作。而 Agent 像一台 " 永动机 ",以机器速度全天候持续查询,并期望一次访问同时获得结构化事实、非结构化上下文及数据关系。Gartner 预测,到 2028 年,超三分之一的企业软件交付将由 Agent 完成。这些 " 硅基员工 " 不休息、不等候、不妥协,对数据底座的弹性、隔离性和成本模型提出了前所未有的要求。

OceanBase CTO 杨传辉在近期一场与 Forrester 首席分析师的对话中点破本质:过去分析采用 T+1 批处理模式之所以成立,是因为人通常周期性阅读报表。但 Agent 不会等待下一份报表,它在业务事件发生的瞬间提问并立即行动。" 实时 " 不再是锦上添花,而是成了底线要求。

二是 Agent 带来的规模问题变得突出。过去业内比较的是 " 单一数据库能承载多大体量 ",AI 时代要面对的却是 " 海量小表 " ——每个应用的数据很小,甚至大部分处于休眠状态,却需要随时实现秒级响应。

比如蚂蚁灵光承载了约 3000 万个闪应用,这些闪应用就是一个个由用户创建的 Agent。它们不是数据库实例,每个 Agent 可能是有几百行代码,但其特点是数量庞大、Schema 动态生成、彼此需要隔离,并且要在用户再次调用 Agent 时继续提供数据服务。

三是数据结构发生了变化,非结构化数据成为 " 一等公民 "。过去,数据库系统主要为结构化数据服务,文本、图像、音视频、向量、JSON 等非结构化数据因机器无法深度理解而长期被排除在管理半径之外,沉睡在成本中心。大模型第一次让它们变得 " 可计算 ",从 " 边角料 " 跃升为企业核心资产。IDC 预测,到 2029 年,全球非结构化数据占比将超过 80%。若其不能与结构化经营数据在同一底座上统一管理、治理和调用,Agent 永远是在 " 盲人摸象 "。

四是 Agent 的工作负载从事务和分析,扩展到搜索、上下文工程与 AI 应用。AI 数据库要解决的不是 " 数据如何存储存 ",而是 "Agent 如何安全、准确并持续地使用数据 "。这些新型负载不再遵循固定的查询模式,而是随 Agent 的决策路径动态变化,对数据底座的并发弹性、混合负载隔离和一致性保障提出了全新要求。

" 当 Agent 需要读取、写入、搜索、实验、回滚并持续构建上下文时,数据库还该保持原样吗?答案是否定的。" 杨传辉观察到,越来越多 CIO/CTO 正在重建数据平台,动力并非追逐 AI 热潮,而是基于一个朴素认知——过去的分析技术栈并非为 Agent 这种新的数据使用者设计。" 我们的任务不只是让旧平台运行得更快,还要重新思考 AI 数据平台应该是什么样子。 " 杨传辉说。

融合成为主流,

OceanBase 与 Databricks 的殊途同归

过去,企业技术栈有明确分工:数据库负责交易,数仓和数据湖负责分析,搜索引擎与向量数据库负责信息检索,模型平台负责训练和推理。这也造成了传统数据架构的一大痛点,同一份数据需要不断在不同系统之间复制、同步和转换,每个系统都有独立的管道、权限和一致性节奏。

这种架构在以前有其合理性。企业以结构化数据为主,应用按照预设流程运行,比如报表按天刷新,应用按写死的流程运行,各系统之间只要靠批处理管道对齐。

但 AI 时代,结构性矛盾开始凸显。一是数据搬运的成本浪费,传统 ETL 模式下,约 30% 的存算资源浪费在搬运和中间落地上;二是 Agent 工作的环境需要处理大量非结构化数据,比如历史文档、图片、音视频、向量等,而传统的数据库系统更多是为结构化数据而设计,非结构化数据被排除在了管理半径之外。三是实时决策的数据新鲜度不够。传统的数据分析通常按照预定周期进行处理,但 Agent 会在业务事件发生的那一刻提出问题,并立即根据答案采取行动。

" 一份晚了三秒的数据副本就可能已经不准确。"Forrester 首席分析师 Indranil Bandyopadhyay 说,Agent 如果基于错误的数据副本行动,带来的可能不是效率提升,而是业务风险。这在企业场景中显然是无法接受的。

数据库与 AI 的融合已经成为行业的共识,目标也非常一致:搭建一套面向 AI 时代的数据基础设施平台,打破数据库、数据湖、分析、搜索和 AI 之间的边界,让不同工作负载围绕统一的数据体系协同运行。

6 月 29 日,OceanBase 发布了湖库一体的 AI 数据库,本质上是把库里的实时事务能力、湖上的开放存储和开放计算能力,放到同一个数据底座上。

它不是简单地给湖仓补充在线查询接口,而是以统一存储、开放计算重构数据处理方式。存储层采用存算分离设计,通过 S3 兼容对象存储、Iceberg 开放表格式和多模表,将结构化字段、JSON、文档、图片、音视频及向量等数据纳入统一的数据与元数据体系;计算层除 SQL 外,还可对接 Spark、Daft on Ray 等开放计算引擎,分别支撑批量加工和多模态 AI 处理,让不同工作负载围绕同一份数据协同运行。

这套现代方案的优势在于,既发挥了数据湖在开放、弹性和成本的优势,又能发挥数据库在事务、一致性、低延迟和治理上的价值。

更重要的是,由于交易数据和分析数据存放在同一系统,Agent 读取的是实时数据,而不是之前生成的数据副本," 这种能力很难在架构完成之后再补上 "。而这对于 Agent 在企业场景的落地尤为关键。

Databricks 则代表了过去十年数据平台的另一条典型路线。Databricks 并非传统意义上的数据库厂商,它从计算引擎 Spark 出发,推出云端大数据分析产品,到 2020 年推出了湖仓一体架构(Lakehouse),将数据湖的灵活性和数据仓库的高性能深度融合,奠定了其行业地位。后来通过资本并购,在 2025 年推出了 Lakebase,补齐了在线事务能力,支持 Postgres 接口直接将数据写入 Lakehouse 存储空间,并使 Spark、Databricks SQL 等其他分析工具能够立即对这些数据进行查询,而无需进行任何 ETL 处理。

2026 年 7 月,Databricks 又进一步提出 LTAP 的概念,尝试在存储层统一事务与分析数据,宣称 " 一套数据,零妥协,零副本 "。

不难发现,Databricks 选择的是在存储层统一数据,试图让湖获得实时事务能力。而 OceanBase 首先在数据库内实现事务与实时分析一体化,再通过 Lakebase 连接对象存储和开放计算,试图让实时业务数据直接服务分析与 AI。

但两条路线并不没有优劣之分。Databricks 本身拥有成熟的数据工程和 AI 开发生态;而 OceanBase 的独特性,则来自关键交易、实时分析和生产级数据库能力。

OceanBase 的技术起点不是数据湖,而是关键交易和实时业务数据。当年,OceanBase 从原生分布式数据库出发,承受住了互联网和金融业务的极限场景考验,解决了生产系统不能停、数据不能错、业务规模持续增长的问题。后来,OceanBase 通过 HTAP 让事务处理与实时分析运行在同一份业务数据上,分析查询不必等待数据进入另一套系统。

如今,OceanBase 通过推出湖库一体 AI 数据库,将能力进一步延伸至开放存储、多模态数据、混合搜索和 AI 计算,让模型和 Agent 拥有实时、完整、可信的业务上下文。OceanBase 从最坚固的交易底座一路向上,长出分析和 AI 能力。

" 有些厂商从 Lake 出发,现在正在增加数据库能力。Databricks 今年做的就是这件事情。而我们 OceanBase 是从数据库出发,再加入 Lake。不同的道路,但最终目的地是一样的。" 杨传辉说。

这句话不仅准确概括了 OceanBase 与 Databricks 的技术差异,背后其实也将二者放在了全球 AI 数据平台公司的竞争坐标系中。虽然起点不同,技术路线也不同,但双方都在指向更加统一的 AI 数据平台。

如今,OceanBase 已经推出了 Lakebase、DataStudio 和 DataPilot 完整 AI 数据平台的产品体系。其中,Lakebase 提供湖库一体、多模态数据处理、混合搜索以及开放存储与计算能力;DataStudio 覆盖数据接入、加工、任务编排、语义建模、治理和服务;而 DataPilot 面向经营分析与业务决策,让业务人员通过自然语言使用企业数据。

这意味着 OceanBase 的能力边界正在从数据库内核,延伸至数据生产、治理、服务和业务使用,并已经具备构成 AI 数据平台的关键产品与技术能力。

中国版 Databricks 背后,

是一场数据库的价值升维

Databricks 的估值从 1000 亿美元涨到 1900 亿美元,中间只花了 11 个月。资本追捧并非简单的市场情绪的偶然碰撞,而是有实打实的业务增长在支撑。2026 年 8 月,Databricks 披露的‌年化营收运行率突破了 70 亿美元‌,其中 AI 产品的年化运行率达 17 亿美元,占总收入约 25%,且是其中增长最快的部分,而三年前这个数字是零。

但更引人瞩目的是,Databricks 专为 Agent 工作负载打造的数据库 Lakebase,上线仅 8 个月,收入便是同期 Databricks SQL(成熟产品)的 2 倍,而且首年 ARR 破 1 亿美元,这也成为企业软件史上成长最快的产品。

这意味着,AI 在企业场景的加速落地,正在推动 AI 数据基础设施的需求井喷。Databricks 为 Agent 打造一个数据平台的叙事,精准切中了企业用户的需求。

而这背后,Databricks 也在给所有数据库厂商带来了全新的价值叙事。

传统数据库的商业模式是按 License 和实例用量收费,天花板清晰可见。而以 Databricks 为代表的 AI 数据平台则是在按 Agent 任务计费,按消费计费——数据存得越多、AI 跑得越勤、Agent 调用越频繁,平台收入自动放大。按座收费的天花板是客户的员工数,消费收费的天花板是客户的工作量。 

正如 Saastr 观察:Figma、Atlassian、Snowflake、Databricks 近一年集体加速增长,共性就是 " 消费定价 + AI 工作负载 " ——旧的 " 规模越大增速越衰减 " 规律在这套模式下失效了。资本市场的定价不是 Databricks 今天有多大,而是它在 AI 数据基础设施层 " 不可替代性 " 的复利效应。

在传统 IT 架构中,数据库作为连接应用与硬件之间的中间层,其价值逻辑是 " 省成本 ",而不是直接创造收入。但当计算向数据迁移,数据所在的物理位置和平台就不再是后台设施,而成了基础设施设计的起点——存储不再是瓶颈,而是企业智能增长的引擎。AI 数据基础设施正在从 " 支撑系统 " 变成 AI 价值链的卡位点和放大器。

但企业把 AI 用进生产环境,要的不只是智能,而是 " 不出错的智能 "。Agent 替代了人去使用数据库,这意味着数据库的可靠性和安全性提出了更高的要求,每一步动作由数据库兜底。这恰恰是 OceanBase 在数据库时代打磨出的核心能力。

OceanBase 并不是 AI 时代横空出世的创业公司。过去十几年,这家诞生于内部业务需求的数据系统,从支撑双十一的海量洪峰到金融、政务场景的大规模行业应用,已经塑造了其最坚实的技术骨架和行业壁垒。

赛迪报告显示,OceanBase 收入位列中国分布式数据库市场第一。IDC 数据则显示,OceanBase 已连续三年在中国金融行业分布式数据库本地部署市场份额排名第一,近七成万亿级资产规模的银行将核心系统搭载于 OceanBase 之上。

2026 年 7 月,OceanBase 进入 Forrester 多模数据平台评估并获评 " 卓越表现者 ",也说明其在多模型事务一致性、实时分析和企业级服务方面的能力,已经进入全球专业机构的观察范围。

当 AI 的需求井喷时,OceanBase 过往的技术和行业积累,成为其走向 AI 数据平台的重要技术基础。正如 OceanBase CEO 杨冰所言,湖库一体的 AI 数据库并不是将过去的一切推倒重来," 真正被重写的,是架构与品类;必须被坚守的,是工程的底线。"

比如 Agent 读取的是账户余额、订单状态、风险规则和实时库存等核心数据,对数据的一致性和服务的可靠性要求非常高,AI 并没有降低数据库的工程标准,反而让这些标准变得更加重要:一致性决定了 Agent 获得的业务状态是否可信;可靠性决定 AI 应用能否持续参与业务流程;实时性决定模型看到的是当前事实还是历史快照;扩展性决定平台能否支撑不断增加的应用和 Agent。

尽管 OceanBase 与 Databricks 当前的收入规模不同,但作为同一赛道、不同起点的中国对标者,这种差距本身也说明市场还有很大的机会。更关键的是,OceanBase 通过在 AI 数据产品和架构上的布局,完成了从 " 数据库公司 " 的旧坐标系到 "AI 数据平台公司 " 新坐标系的切换。

中国版 Databricks 的叙事不是一个概念的炒作,而是理解 OceanBase 业务逻辑和资本估值的一个标尺。它不再只是一家分布式数据库公司,也正在成为中国 AI 数据平台的重要力量。

© 本文为数智前线(szqx1991)原创内容

未经授权,禁止转载

进群、转载或商务合作联系后台

文章精选

不甘平庸的李健和一个更敢的荣耀

今年前 7 个月数据中心亿元中标大单超 158 个,呈现八大趋势

AI 编程更挣钱,为什么大厂全冲去做 AI 办公

从个人 Agent 到企业级数字分身:组织 AI native 转型的 " 最后十公里 "

2026 年下半年,算力竞赛为何突然转向超节点?

当 AI 成为生产力,蚂蚁数科建了一座 " 智能体超级工厂 "

海康威视,用大模型把产品重做一遍

置身米外,小米手机降速和裁员背后

高质量 Token 为何紧缺?AI 基础设施建设有三个新信号

营销与交易增长,进入 Agent 时刻

千问用一张高考志愿表,撕掉 AI 的 " 玩具 " 标签

除夕夜,阿里云扔出了一颗开源 " 王炸 "

历史进程中的浙大

松下电视的结局,藏着日本家电的宿命

大模型五大 " 标王 " 与六边形战士

枪响在 2018:神秘东方力量,为何扎堆杭州

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai oceanbase 融资 数据库
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论