
作者 | 王涵
编辑 | 漠影
AI 落地的真正拐点,已经不在模型本身。
当通用大模型足够强、足够便宜之后,企业突然发现:真正卡脖子的,是自己的数据。散落在各处的交易记录、文档、图片、日志,以及那些还没被整理的向量,能不能被 Agent 真正用起来?
正是这一问,把数据层推到了台前。当数据库的使用主体从人变成了海量 Agent,数据类型从结构化扩展到多模态,要求也从 " 存得下 " 变成了统一管理、实时检索、语义理解与安全合规。
这些变化正在重写整个数据市场的边界。
9 月 10 日,2026 Inclusion · 外滩大会《数智进化:让多模态数据成为 AI 核心燃料》见解论坛上,IDC 中国企业软件市场研究经理王楠发布最新研究。
研究重新划定了 "AI 数据基础设施 " 的版图,并给出清晰判断:中国市场将从 2025 年的约 149 亿美元,增长到 2030 年的 738 亿美元,到 2035 年有望达到约 1 万亿人民币规模。
万亿级新市场正在打开,而最先卡位的,将是那些真正能把数据变成 AI 燃料的底座。
一、大模型不适配真实生产环境,企业选择 " 小模型微调 + 多模态底座 "
通用大模型直接搬进企业生产环境,会遇到几堵绕不过去的墙。
第一堵墙是成本。
通用大模型参数量大、推理开销高,企业业务中每一次调用都在消耗算力。对于高频、规模化的生产场景,全量调用通用大模型的 token 成本和 GPU 算力开销,企业实在吃不消。
第二堵墙是延迟。
企业在线业务对响应时间的要求是毫秒级,而通用大模型动辄数秒的生成速度,无法嵌入交易、风控这类实时链路。
第三堵墙是幻觉与口径。
通用大模型缺乏对企业自有数据口径、业务规则和行业知识的理解,直接使用会导致回答失真。IDC 在报告中提到,口径不一会导致 AI 回答失真,企业因此正在优先考虑数据质量、数据血缘和元数据,以确保 AI 输出的一致性和可信度。
第四堵墙是数据隐私与领域适配。
在金融、政务等强监管行业,数据不能出域,通用大模型无法直接接触企业核心数据;而行业知识散落在企业内部的文档、报表、流程系统中,通用模型既不掌握,也难以获取。
瓶颈既然在数据,解法也落在数据。
IDC 此次研究给出的企业选型建议中,明确列出了一条关键路径:拥抱 " 小模型 + 多模态底座 " 模式——聚焦构建强大的多模态数据底座,结合行业知识与场景数据,通过小模型微调实现高效、可控的生产级 AI 落地。
企业不需要在每一个业务环节都调用参数量最大的通用模型,而是用自有场景数据微调出小模型,让模型在特定任务上足够专、足够快、足够便宜。
而微调的前提,是企业能够把散落在各处的数据——结构化的交易记录、半结构化的日志、非结构化的文档图片,以及 AI 原生需要的向量数据——统一管理起来,形成可供模型消化的 " 燃料 "。
这解释了为什么多模态数据底座成为必选项。
IDC 数据显示,企业新生成的数据资产中约 90%为非结构化形态,文档、图片、音视频正在成为数据资产的主体。传统数据架构主要围绕结构化数据设计,处理这部分数据的能力缺口直接制约了 AI 落地。
二、新路径给数据基础设施带来冲击,万亿新市场诞生
" 小模型 + 多模态底座 " 的生产级路径,对传统数据基础设施的冲击是全方位的。
蚂蚁集团基于 OceanBase 的实践显示,当 Agent 成为基础设施的使用方,其数量级远超人类工程师。据介绍,蚂蚁内部的 AI 应用平台 " 灵光 " 已累计生成数千万个 " 闪应用 ",平均每个仅百余行数据,99% 处于沉睡状态,极少数被唤醒时却要求秒级响应。
这意味着数据底座要解决的不再是把一个库做大,而是让百万级、千万级的库高密度共存、按需唤醒。
数据体量本身也在快速膨胀。IDC 预计,中国数据生成量将从 2025 年的 76.05ZB 增长至 2030 年的 146.65ZB,五年接近翻倍。
面对这个被重构的市场,IDC 此次没有沿用传统的数据库、数据仓库分口径统计,而是重新划定了 "AI 数据基础设施 " 的市场边界,将其划分为三大子市场:
AI 数据管理平台:承担多模态数据的统一管理和处理,是 AI 应用的数据底座。这是规模占比最高的子市场。
AI 数据智能:利用 AI 提升数据治理、分析和使用效率,包括 AI 辅助数据治理(用生成式 AI 提高数据目录、分类分级、质量检测、知识抽取和文档理解效率),以及 Data Agent 与数据产品。这是增速最快的子市场。
AI 数据服务:从传统数据标注向更复杂的数据工程和数据运营体系升级,RAG 知识库持续运营、Agent 轨迹数据集构建、行业数据集更新等持续性服务占比持续提升,多模态非结构化数据爆发带动多模态、合成数据服务扩张。


三、OceanBase 的新卡位:AI 数据基础设施的底座与入口
IDC 报告还提出,未来的竞争在于谁能够率先形成覆盖 " 数据管理—数据智能—数据服务— Agent 消费 " 的完整闭环,而 OceanBase 的产品体系正在这一方向上布局。
2026 年 6 月 29 日,OceanBase 发布面向 AI 时代的湖库一体 AI 数据库,核心思路是将数据湖的开放与海量存储能力、数据库的事务处理与分析能力,以及多模态数据处理能力,统一到一套数据架构中,为 AI 应用和 Agent 提供统一的数据基础。
OceanBase Lakebase:湖库一体的 AI 湖库,原生支持结构化、半结构化、非结构化等多模态数据统一管理与处理,并融合实时分析、混合搜索及开放计算等能力。
Lakebase同时提供 DataStudio 等数据生产、治理和服务能力,以及面向 Agent 场景的数据沙箱,支持大规模生产级 Agent 基于真实数据快速创建隔离环境,用于 Agent 评测、实验和验证。


这套产品组合正好对应 IDC 给出的市场分类的核心板块:Lakebase 和 seekdb 对应 AI 数据平台,DataPilot 和 AgentSeek 对应 AI 数据智能,DataStudio 和持续数据服务对应 AI 数据服务。
OceanBase,承担起了 AI 应用和 Agent 的统一数据底座与数据入口的新角色。
四、目标是 Databricks,OceanBase 的增长空间才刚刚打开
市场格局变化了,OceanBase 的价值自然需要重新定位。
传统数据库公司的估值逻辑,看的是市场份额、收入、利润和云化进度。在这个框架下,OceanBase 面对的是分布式事务型数据库市场,天花板清晰可见。
然而,AI 数据平台的估值逻辑看的是另一组指标:TAM(总可触达市场)、平台化能力、Agent 数据入口、生态闭环、全球对标。
按照这个标准,OceanBase 的价值定位标杆就是 Databricks。
这家 2013 年由 Apache Spark 创始团队创立的公司,2026 年 8 月 13 日完成 50 亿美元战略融资,估值 1900 亿美元。
仔细看这两家的产品,你会发现一个小细节:Databricks 把面向 Agent 的数据库产品命名为 Lakebase,OceanBase 把湖库一体引擎也命名为 Lakebase。
两家从相反方向出发的公司—— Databricks 从数据湖和数据分析起家,向数据库和企业应用延伸;OceanBase 从分布式数据库和核心交易系统出发,向企业全量数据管理、Agent 数据供给和数据服务拓展——把产品命名收敛到了同一个词上。
用 OceanBase CTO 杨传辉自己的话说就是:"不同的路,同一个终点。"
立足当前行业格局,OceanBase 正处于高速成长的黄金起步阶段。
据彭博 2026 年 7 月 29 日消息,OceanBase 正在推进首轮 A 轮融资,目标融资规模 20 亿至 30 亿元人民币,这也是其自诞生以来首次引入外部市场化资本。商业化层面,OceanBase 2026 年年化收入突破 14 亿元,同比增速高达 70%。
若以 Databricks 估值 1900 亿美元为目标,OceanBase 的增长空间,将没有天花板。
结语:AI 下半场的胜负手,在于数据基础设施
IDC 在报告中写道:未来企业 AI 落地的竞争焦点将彻底从 " 模型军备竞赛 " 转向 " 数据基建比拼 "。
头部模型的通用能力趋同且足以够用。当好模型不再稀缺,稀缺的就变成了数据层的能力差异。
数据层的和模型层的逻辑不太一样。数据基础设施的构建周期长、涉及环节多、迁移成本高,一旦形成技术壁垒和客户黏性,后来者很难在短时间内追上。这意味着,先行者的优势会随着时间推移不断放大。
放在中国市场来看,这个判断更加成立。中国不缺数据,也不缺场景。缺的是能把数据变成 AI 燃料的基础设施。这个空白正在被填补,而填补它的公司,或将定义下一代企业数据平台的形态。


登录后才可以发布评论哦
打开小程序可以发布评论哦