AI 正在进入一个有点反直觉的阶段:模型越来越强,企业却越来越发现,真正卡住 AI 落地的,不一定是模型。
刚刚结束的 2026 Inclusion · 外滩大会上,IDC 中国企业软件市场研究经理王楠发布了一份关于 AI 数据基础设施的研究。报告给出的一个判断值得琢磨:在越来越多企业级应用中,大模型本身的能力已经不再是唯一的主要瓶颈,真正卡住 AI 从试点走向规模化落地的,正在变成数据能力。
这个变化放在两年前很难想象。
那时候行业的注意力全在模型和算力上,基座参数一路往上堆,推理芯片一卡难求,企业采购清单里 GPU 占了大头。
但到了 2026 年,企业 AI 落地的真实痛点正在发生变化。
邓白氏覆盖 32 个国家 1 万家企业的调查显示,97% 的企业正在推进 AI 项目,只有 5% 认为自身的数据做好了充分准备。Forrester 在今年初的研究里给出更具体的归因,大部分 RAG 实施失败可以追溯到数据质量问题,而非检索算法或语言模型本身。
行业的瓶颈正在换位置。AI 上半场拼模型和算力,下半场拼的是数据基础设施。
模型够用了,数据卡住了
一个越来越普遍的现象是,模型买回来、算力租好了,AI 项目却卡在了试点到生产的那一步。
Databricks 的调查显示,仅有 37% 的高管认为其生成式 AI 应用已经具备投入生产的能力。IDC 的调研把这个问题拆得更细,46% 的企业表示 AI 数据准备工作是 2026 年的首要任务,企业新生成的数据资产大约 90% 是非结构化形态,文档、图片、音视频、向量数据大量涌入,但传统数据架构主要服务于交易、分析和报表,处理不了这些新东西。
再加上跨部门的数据孤岛、口径不一致导致的 AI 回答失真、高延迟支撑不了 Agent 的实时响应,每一个都是硬骨头。
企业不缺 AI 的意愿,缺的是让 AI 能用起来的数据。
问题不只是数据更多了,而是数据的使用方式也变了。过去,数据主要服务业务系统和人;现在,Agent 也开始成为数据的使用者。过去,数据库主要处理结构化数据;现在,文档、图片、音视频、向量等非结构化数据不断进入生产系统。过去,数据能存、能查就够了;现在,AI 需要的是实时、统一、可理解、可调用的数据。
这几种变化叠在一起,传统架构的缺口被进一步放大。
中国数据生成量的增速也在加剧这个矛盾。IDC 预计,中国数据生成量将从 2025 年的 76.05ZB 增长到 2030 年的 146.65ZB,五年接近翻倍。数据量在涨,数据形态在变,传统架构的处理能力却没有跟上。
Databricks 在一篇博客里把话说得更透彻,银行没有 AI 问题,它们有数据平台问题。客户、风险、产品的数据碎片化且不一致,AI 再强也跑不出结果。
换句话说,AI 的瓶颈正在从 " 有没有模型 ",变成 "AI 能不能拿到正确的数据 "。
这件事的底层逻辑是,AI 的成本结构变了。上半场成本主要在算力,买更多 GPU 就能训练更大的模型。下半场成本主要在数据工程,找数据、洗数据、管数据、让数据能被 AI 理解和调用,占了 AI 项目大部分的时间和预算。
当模型不再是唯一稀缺资源,如何把企业自己的数据真正变成 AI 可以使用的资源,开始成为新的竞争点。
被重构的数据底座
如果说大模型时代的数据需求还停留在 RAG 检索层面,Agent 时代就完全不一样了。
Agent 要替人干活,要实时查库存、调订单、做决策、执行操作。它需要的已经超出了静态知识库的范畴,是一个能实时、可靠、统一管理多模态数据,还能被 AI 理解和调用的底座。
IDC 把这个新市场定义为 AI 数据基础设施,划成三大主要领域。
AI 数据平台负责多模态数据的统一管理和处理,是 AI 应用的数据底座。AI 数据智能利用 AI 提升数据治理、分析和使用效率,是增速最快的细分市场,2025 到 2030 年复合增长率达到 48.2%,增长动力已经从传统治理工具升级转向大模型和 Agent 驱动的数据价值迁移。AI 数据服务则从传统标注走向知识库运营、评测数据、合成数据等持续性服务,复合增长率 30.7%。

王楠在发布会上说,未来竞争的关键在于谁能率先形成覆盖数据管理、数据智能、数据服务到 Agent 消费的完整闭环,关键路径是小模型加多模态底座。
行业玩家已经开始沿着这条路径调整。
今年 6 月,Databricks 在 Data+AI Summit 上发布了 LTAP 架构,把交易、分析、流处理和运营数据统一到湖仓的一份存储上,从设计上消除了 ETL 和数据管道。Databricks CTO Matei Zaharia 在会上讲了一个观点,把数据放到正确的位置,然后叠加通用智能体,系统就会运转,但前提是数据要到位。同期发布的 Lakebase 和 Agent Bricks,本质上都是在补数据平台这一层。
国内的动作几乎同步。
6 月 29 日,OceanBase 在线上发布会上推出了面向 AI 时代的湖库一体 AI 数据库,同时亮相的还有 Lakebase、DataStudio、DataPilot 等产品。OceanBase CEO 杨冰在发布会上说,这已经超出了传统数据库功能升级的范畴,是面向 AI 时代的一次基础设施重建。
OceanBase 给这套产品的定位是三层。
底层 Lakebase 融合数据库、开放存储、分析和多模态数据处理,构建企业全量数据的一体化底座。中层 DataStudio 覆盖数据接入、加工、编排、语义建模到 Agent 协作,把分散的数据资产转化为可调用的数据服务。上层 DataPilot 让业务人员用自然语言就能查数据、做归因分析、生成看板,把数据能力从工程师手里释放到业务人员和 Agent 手里。
从这个路径看,OceanBase 想解决的已经不只是数据库本身的问题,而是企业数据如何被 AI 真正消费的问题。
这背后其实是一次数据架构的变化。
过去四十年,数据库行业一直是 OLTP 和 OLAP 分离的架构,交易系统跑交易,分析系统跑分析,中间靠 ETL 搬运数据。
这个架构在给人做报表的时代够用,但到了 Agent 时代就成了负担。Agent 需要实时拿到完整的业务上下文,交易数据和分析数据割裂、结构化和非结构化数据割裂、数据库和向量库割裂,每多一次搬运就多一层延迟和不一致。
湖库一体试图解决的正是这个问题:让交易、分析、多模态数据和 AI 应用尽可能建立在更统一的数据底座之上,减少数据搬运,让 AI 能够更直接地获得业务上下文。
所以,AI 数据基础设施并不是给传统数据库简单增加几个 AI 功能,而是在重新定义数据底座应该承担什么。
数据库过去主要解决 " 把数据存好、把数据取出来 ",未来则需要进一步回答:如何让 AI 理解数据、调用数据,并基于数据持续完成任务。
一个万亿市场正在打开
IDC 给这个新市场算了一笔账。
2025 年,中国 AI 数据基础设施市场规模约 149 亿美元。2025 到 2030 年复合增长率 37.7%,2030 年达到 738 亿美元。到 2035 年有望达到 1548 亿美元,约合 1 万亿人民币,较 2025 年增长超过 10 倍。

作为对比,沙利文预测中国分布式事务型数据库市场 2030 年约 129.3 亿元人民币 ,2025 到 2030 年的复合增长率约为 18.5%。
两个数字放在一起,更值得关注的其实不是市场规模的差距,而是市场边界正在发生变化。
过去,数据库厂商竞争的核心问题是:谁能承接更多企业核心业务。AI 时代,问题开始变成:谁能进一步承接企业的数据处理、数据智能,以及 Agent 对数据的持续调用。这意味着,数据库厂商面对的已经不只是原来的数据库市场,而是一个正在向更大范围数据基础设施扩展的新市场。
IDC 把市场里的玩家分成了三类。
云厂商从模型和算力向数据底座延伸,代表是阿里云、火山引擎,优势是协同能力和开发者生态,挑战在于数据主权和跨云整合。数据库和湖仓厂商从企业核心数据底座向语义、知识和 Agent 扩展,代表是 OceanBase 和 Databricks,优势是承载了核心数据、HTAP 能力成熟,挑战是传统架构包袱和模型生态。独立 AI 数据软件商从向量、治理、特征工程切入,代表是 Zilliz,优势是 AI 原生、迭代快,挑战是客户基础和平台完整度。
三类厂商从不同的控制点进入同一个赛道,最终都要回答同一个问题:
谁能先形成数据管理到 Agent 消费的完整闭环?

OceanBase 的位置,也值得放在这个变化中重新观察。
在分布式数据库这个基本盘上,沙利文报告显示 2025 年下半年到 2026 年上半年,OceanBase 以 20.2% 的市场份额位居中国分布式事务型数据库第一。赛迪的报告也显示,OceanBase 2025 年收入大幅增长,位列中国分布式数据库市场第一。在数据库管理系统厂商竞争力评估中位于领导者象限,产品能力排名第一。
但对 OceanBase 来说,真正值得观察的恰恰是 " 第一 " 之后。
在国产数据库升级的周期里,市场份额代表的是企业核心系统的承载能力;进入 AI 数据基础设施的新周期之后,考验的则是能不能把这种能力继续延伸到更多数据类型、更多数据场景,以及 Agent 的数据消费。
OceanBase 已经积累了一批金融、政务、能源等行业的核心客户。这些行业的数据有一个共同特点:业务核心、实时性强,而且对安全和稳定性有较高要求。
这也构成了数据库厂商进入 AI 数据基础设施市场的一条特殊路径。
据彭博报道,OceanBase 正在进行外部融资,并将 Databricks 等数据基础设施公司作为发展参照。据知情人士透露,其 2026 年年化收入已超过 14 亿元,同比增长约 70%。
这些数字说明一件事,市场第一远非天花板,它只是进入 AI 数据平台新阶段的起点。
全球范围内,Databricks 从数据湖和数据分析出发,正在向交易数据延伸;OceanBase 则从分布式数据库和核心业务系统出发,向湖、多模态数据和 AI 应用延伸。两条路径在 Agent 时代交汇,终点都是企业 AI 的数据底座。
市场对这类公司的观察框架,也需要从数据库厂商的份额逻辑,切换到数据基础设施平台的 TAM 和生态逻辑。IDC 把市场天花板从百亿级抬到万亿级,OceanBase 把位置从中国分布式数据库领先者换到全球 AI 数据平台,市场需要给出的,是一套新的估值坐标。
小结
前阵子看到一个说法,AI 项目里大部分的工作其实和模型无关,都在处理数据。
这句话或许比 " 模型越来越强 " 更值得关注。
AI 上半场拼的是模型和算力,下半场拼的可能是数据和调用。当所有人都在抢 GPU 的时候,那些沉下心把企业数据底座做扎实的公司,会在下一个阶段拥有不一样的位置。
毕竟,模型可以调用很多家,但企业自己的数据,只有一份。


登录后才可以发布评论哦
打开小程序可以发布评论哦