"AI 的下半程是数据,高质量数据集已成为 AI 实现智力跃迁的基石。数据是企业与机构最为核心的竞争力。" 华为数据存储产品线副总裁肖德刚,在 8 月 28 日举办的 2026 中国国际大数据产业博览会 " 聚焦场景建设释放数据价值 " 交流活动上表示。
全球数据规模正以每年 43% 的速度快速增长,国家层面已出台多项政策推动高质量数据集建设。其中,数据基础设施存力中心的建设是高质量数据集的重要基座。
" 未来行业高质量数据集建设需要龙头企业带动。" 肖德刚说,过去两年,华为与某国家实验室在农业领域深度合作,建立了农业数据基础设施存力中心,赋能育种科研创新,已构建全国一体化的育种数据基础设施和农业数据基座,可实现自动化数据产线科研范式支持与调度,项目已进入二期收尾、即将启动第三期。

华为数据存储产品线副总裁肖德刚发言。
针对数据基础设施存力中心的建设实施层面,肖德刚介绍,华为推出 AI 数据湖解决方案,聚焦从三个维度为高质量数据集夯实根基:
在聚好数方面,基于 OceanStor Pacific 数据湖存储,结合 iMaster DME Omni-Dataverse 统一数据空间,使能 EB 级数据全局可视、可管、可用。通过全局统一视图,确保数据资产注册 0 遗漏、更新 0 等待;凭借智能数据目录,完成跨域数据统一元数据管理,支持自动编目及向量化;同时依托可信数据空间,保障跨域数据流动可信、可证、可控。
在治好数方面,通过 DCS 一站式 AI 工具链,攻克 AI 落地过程中数据工程、模型工程、应用编排等难题。内置 60 余种多模态算子,将数据处理周期缩短 80%;支持一键部署模型,兼顾训推共池调度、昼推夜训能力,提升智算资源利用率 30%;通过零代码拖拽式可视化编排,让 AI 行业应用上线周期缩短 80%。
在用好数方面,依托 iData AI 数据服务,搭建完善的知识工程体系,贯通知识建模、提取、融合全流程,助力海量数据源快速沉淀为高精度业务知识库。一方面,让知识从数据中高效萃取与生长,基于专家经验建模,结合端到端工具链,快速建立跨模态知识图谱,知识激活率提升 70%;另一方面,让海量多模知识被精准调用,支持以自然语言方式驱动的极速检索形式,完成千亿向标量数据中秒级检索,检索精度超过 90%。
天眼新闻记者 李姗
图 / 刘青
编辑 鲍贝贝
二审 管云
三审 岳振


登录后才可以发布评论哦
打开小程序可以发布评论哦