
模型决定了 Agent 聪不聪明,企业数据决定了它懂不懂你的生意。
文|周享玥 赵艳秋
编|牛慧
为什么同一个大模型,用英文回答科学和工程问题时,常常更顺、更有条理?
答案不只在模型,也在数据。现代科学体系中,大量论文、代码和工程文档最初就用英文写成,不仅记录结论,也保留了研究过程和论证关系。模型从中学到的,不只是一门语言,也是一套知识和逻辑的组织方式。
模型越来越强之后,胜负手正在重新落回数据。
尤其当 Agent 开始进入企业核心业务,数据也从模型训练的原料,变成 AI 运行过程中持续调用的基础设施。
过去二十年,我们解决的是 " 怎么把数据存下来 ";Agent 时代,新的问题变成了 " 怎么让数据持续供给智能 "。
现在,华为想做的,是把过去二十年的 " 大数据 " 再重做一遍。
新用户:Agent 来了,数据的消费者变了
去年,沃尔玛中国一度严禁员工用外部大模型讨论工作,数据泄露风险让大型跨国企业对 AI 极为谨慎。但今年五六月份后风向突变,企业开始认真将核心业务推进到企业级智能体时代。
变化背后,是企业使用 AI 的方式变了:从员工调用外部工具,变成企业系统性引入 AI。
Coding 助手、办公 Agent 已经证明能提升个人效率,但企业真正要解决的是跨部门、跨系统的长流程问题,需要多个 Agent 共享上下文、调用企业系统并协同完成任务。
Gartner 已将多智能体系统列入 2026 年十大战略技术趋势,并预计到 2028 年,超过 1/3 的企业软件将具备自主 Agent 能力。
这种变化已在互联网、金融、制造等行业出现。互联网头部企业正密集整合办公 Agent 与企业工作流;2026 年上半年,金融大模型中标项目达到 406 个,国有大行、头部股份行开始从知识助手、代码助手向信贷、风控、合规等业务型 Agent 推进;制造、能源企业也开始把 Agent 带进质检、研发和调度。
问题也随之出现。
Agent 不是 " 偶尔查一次数据的人 ",而是一个 24 小时不停读取、检索、推理和行动的数据消费者。
人查数据是低频、有节奏的;Agent 执行任务,却需要不断检索知识、读取实时状态、调用历史信息,再根据结果继续推理和行动。
数据因此不再只是躺在系统里的资产,而开始成为 Agent 的上下文、记忆,甚至是它做出下一步行动的依据。
8 月 28 日,在 " 从数据到 Agent:数据价值链的重构与创新 " 数据要素大会上,华为混合云总裁顾雪军直指这一问题:" 企业没有自己的数据,智能体就只是一个通用的聊天机器人,永远触不到核心业务。"

企业真正的竞争,也因此不再只是 " 有没有模型 ",而是谁能把自己的数据、流程和行业 Know-how 持续沉淀进智能体。
埃森哲调查显示,88% 的中国企业已跨过 AI 试点阶段,但取得显著业务价值的只有 14%。
而企业数据本身也在发生变化。过去的数据平台最擅长处理数据库里的表和字段,但文本、图片、音频、视频、设备日志等非结构化数据,正在成为企业 AI 最重要、也最难处理的数据来源。Gartner 预计,到 2028 年,中国企业对 AI-Ready 数据、尤其是非结构化数据的投资将达到 2024 年的 20 倍。
新的数据消费者,正在倒逼一代新的数据基础设施。
新断代:大数据从 1.0 走到 3.0
顾雪军判断,Agent 时代,大数据平台的服务对象正从 " 人和 BI" 扩展为 " 人 + 大模型 +Agent"。
服务对象变了,数据基础设施就必须跟着换代。
华为将这一过程概括为大数据 1.0、2.0 和 3.0 三个阶段。
1.0 时代,服务人。
数据库、数仓和数据湖把结构化数据存下来、管起来、算起来,通过 BI 和报表交给人分析决策。华为从 2008 年开始布局大数据,此后推进存算分离、湖仓一体,解决的核心问题都是如何把数据存好、管好、算快。
2.0 时代,模型成为新的数据消费者。
图片、视频、音频、文本等非结构化数据大量进入 AI 训练,传统湖仓向多模态湖仓演进,多模计算、异构算力调度、自动标注和高质量数据集生产成为新的基础能力。
行业格局也随之变化。海外 Databricks 迅速从 Data 公司转向 Data+AI 公司;国内华为推出 DataArts、DataArts Fabric 以及城市和行业数据空间,数据平台开始从治理工具走向 "Data+AI"。
3.0 时代,Agent 成为新的数据用户。
与人看报表、模型吃数据集不同,Agent 需要在运行中持续获得企业数据和业务知识,并据此推理、决策和行动。
如果说大数据 1.0 解决 " 人怎么用数据 ",2.0 解决 " 模型怎么吃数据 ",那么 3.0 真正要解决的是 "Agent 如何一边工作,一边持续获得数据 "。
数据平台开始从 " 存储数据 " 走向 " 持续供给智能 "。
徐工全球数字化中心主任付思敏在大会现场提到,徐工的数据体系过去主要面向内部决策运营和 BI,如今已经开始转向以高质量数据集支撑 AI 模型和产品应用。
围绕这一变化,华为今年将数据能力重新组织为四个环节:可靠管数、高效供数、智能用数和可信流通。
过去的大数据平台像仓库,今天的数据基础设施更像一套供血系统:数据不仅要存得住,还必须随时流向正在工作的 Agent。
新范式:数据平台开始长出 " 记忆 "
可靠管数、高效供数、智能用数和可信流通,本质上,就是形成一套持续向智能体 " 供血 " 的系统。
可靠管数是地基。Agent 最终仍要查数、计算、调用业务数据,因此传统湖仓并没有失去价值,反而要求底座更快、更稳。
真正发生质变的是 " 供数 "。
模型和 Agent 有着不同的 " 数据胃口 ":模型需要规模和质量,Agent 则需要持续检索、记忆和共享。
顾雪军将这种变化概括为,让数据从 " 静态治理资源 " 转变为 " 动态赋能 AI 的生产力 "。
华为云今年推出 AI DataLake,一边加快 TB/PB 级训练数据集构建,一边在数据湖中引入向量和记忆引擎,为 Agent 提供 " 知识检索 + 记忆检索 ",支持长期记忆和多 Agent 共享。
这意味着一个非常重要的变化:数据基础设施第一次开始系统性地管理 " 记忆 "。
过去数据库保存订单、客户和库存,数据湖保存文本、图片和视频;未来还要保存 Agent 做过什么、哪些办法成功、哪些办法失败,再把这些经验用于下一次推理。
企业数据不再只是 " 发生过什么 " 的记录,还将成为 " 下一次怎么做 " 的经验。
另一个重新受到重视的概念是 " 本体 "。
大模型能找到数据,却未必知道企业如何运转。本体要补上的,就是业务语义:把企业里的人、财、物、事及其关系和规则,用机器能够理解的方式重新描述。
一条生产订单背后,可能同时关联 ERP 里的 IT 数据、设备产生的 OT 数据、研发系统中的 ET 工程数据,以及规章制度和专家经验形成的 KT 知识。华为的智能数据决策平台 DataArts,正试图通过本体语义建模,把这些数据重新组织成业务对象、关系和规则。
AI 真正进入企业,难点不是让它 " 看见数据 ",而是让它 " 看懂生意 "。
微软 Fabric、Snowflake、Palantir 等也都在强化本体或业务语义层,目标相似:让 AI 找到数据之后,还能理解数据背后的业务关系。
顾雪军此次演讲中出现了一条值得注意的链路:Data → Logic → Action。
过去是 Data → Insight,数据产生洞察,再由人判断和执行;Agent 时代则进一步走向 Data → Logic → Action。
比如发现供应链交付风险后,Agent 不只是提示异常,还要关联库存、采购、产能和物流判断原因,生成方案并调用业务系统执行。
过去,数据的终点是 " 让人看懂 ";Agent 时代,数据的终点正在变成 " 让机器行动 "。
这个闭环还在向企业外部延伸。国家数据局今年提出通过可信数据空间等推动数据安全流通,华为也将可信数据空间纳入大数据 3.0,让外部数据在 " 可用不可见 " 的条件下进入企业 AI 体系。
至此,数据平台正在从存储和分析系统,进一步变成 AI 的实时供应系统、长期记忆系统和决策底座。
新证明:数据开始形成两个飞轮
大数据 3.0 已经不只停留在架构和产品层面,第一批验证开始进入真实生产。
" 没有高质量的数据集,再强的模型在任何一个行业其实都跑不出好结果。" 广东电网数据运营中心平台管理部部长杨永娇直言。
工业场景尤其如此。要让 AI 进入生产,首先要通过清洗、标注、合成和评估,把工业现场的 " 数据原油 " 炼成可供模型使用的 " 数据汽油 "。
一些结果已经体现在生产指标上:宝钢将数据工程和模型用于宽展预测、高炉炉温预测,单炉成本每年降低千万级;中铝仅氧化铝生产每年节约成本 1100 万元;中国石油将油田测井周期从周级缩短至天级,准确率达到 95%。
徐工则从场景反推数据建设,把 AI 落地分成 "AI+ 产品、AI+ 制造、AI+ 企业运营 " 三条线,仅制造环节就梳理出 82 个核心场景,并围绕这些场景建设约 30 个高质量数据集。
这意味着企业建设数据的逻辑也在反过来:不是 " 有什么数据就做什么 AI",而是 "AI 要解决什么问题,就生产什么数据 "。
一些企业甚至开始把数据做成持续运转的 " 生产线 "。
广东电网把高质量数据集建设拆成 " 采、治、标、训、评、用 " 六个环节。模型上线产生的低置信度样本和误判数据重新回流,进入下一轮训练。目前已积累超过 3000 万份多模态样本,在输电巡检场景中,识别准确率超过 90%,缺陷误报率降至 5% 以内。
这形成企业内部的第一个飞轮:业务产生数据→数据训练模型→模型进入生产→生产产生新反馈→反馈再次改善数据和模型。
数据不是越存越多,而是越用越好。
第二个飞轮则开始越过企业边界。
华为已参与贵州省级 " 公共数据一个湖 " 和 AI 可信数据空间建设;云南交投采购外部通用数据,与自身交通数据组合,形成 " 建、管、养、运、服、安 " 六类高质量数据集,不仅用于行业大模型训练,还在深圳数据交易所挂牌交易。
国家数据局将类似过程概括为 " 场景牵引数据、数据驱动模型、模型赋能应用、应用创造价值 " 的 " 数据飞轮 "。
于是,一个更大的循环出现了:企业内部,数据和 Agent 互相增强;企业外部,数据通过可信流通进入更多场景,再创造新的数据与价值。
当两个飞轮同时转动,数据才真正从 " 沉淀下来的资产 ",变成 " 持续生产智能的生产资料 "。
过去二十年,企业一直在问一个问题:我们积累了这么多数据,价值到底在哪里?
Agent 或许第一次给出了一个非常具体的答案。
数据的价值,不在于企业 " 拥有多少 ",而在于有多少能够被 AI 理解、调用,并最终变成行动。
模型表现出来的能力,终究要落到它吃到了什么数据。
而当 Agent 真正进入企业核心业务,决定它能走多远的,也许不再只是模型有多强,而是企业过去二十年攒下来的数据,能不能从一座沉默的 " 矿山 ",变成一套持续运转的 " 智能供给系统 "。
这也是为什么,Agent 时代,大数据不是过时了,而是必须重新做一遍。
© 本文为数智前线(szqx1991)原创内容
未经授权,禁止转载
进群、转载或商务合作联系后台
文章精选
具身 ChatGPT 时刻前夜,自变量押注 " 最强大脑 "
AI 改变钱的流向:预算、自研与最后一公里
OceanBase,走向中国版 Databricks
美团把踩过的坑变成经验,做成了给全行业的低成本 AI 系统
不甘平庸的李健和一个更敢的荣耀
AI 编程更挣钱,为什么大厂全冲去做 AI 办公
从个人 Agent 到企业级数字分身:组织 AI native 转型的 " 最后十公里 "
2026 年下半年,算力竞赛为何突然转向超节点?
当 AI 成为生产力,蚂蚁数科建了一座 " 智能体超级工厂 "
海康威视,用大模型把产品重做一遍
置身米外,小米手机降速和裁员背后
高质量 Token 为何紧缺?AI 基础设施建设有三个新信号
营销与交易增长,进入 Agent 时刻
千问用一张高考志愿表,撕掉 AI 的 " 玩具 " 标签
除夕夜,阿里云扔出了一颗开源 " 王炸 "
历史进程中的浙大
松下电视的结局,藏着日本家电的宿命
大模型五大 " 标王 " 与六边形战士
枪响在 2018:神秘东方力量,为何扎堆杭州


