【CNMO 科技消息】9 月 7 日,中国信息通信研究院(以下简称 " 中国信通院 ")正式启动 " 方升 " 智能体基准测试任务征集工作。此次征集旨在汇聚高质量任务资源,进一步完善智能体测试任务、测试环境和评价方法。

AI 示意图
中国信通院 " 方升 " 智能体基准围绕基础能力、典型场景和复杂综合任务三大维度构建分层测试框架。这一设计旨在推动智能体测试从传统的 " 能说会道 " 式评估,向综合能力测量、过程分析和问题诊断等更深层次拓展。随着 AI 智能体从 " 回答问题 " 走向 " 执行任务 ",传统的单一维度测试已难以全面衡量其真实能力,分层测试框架的建立正当其时。
" 方升 " 并非全新品牌。作为中国信通院联合多家头部大模型企业、用户单位和科研机构共同制定的评测体系," 方升 " 此前主要聚焦于大模型基准测试。2025 年 10 月,中国信通院已发布 " 方升 "3.0 大模型基准测试体系,对国内外 141 个大模型、7 个智能体进行了测试,公布了大语言模型基础能力、复杂推理能力、代码能力等多维度结果。此次启动智能体基准测试任务征集,标志着 " 方升 " 体系正从大模型评测向智能体评测延伸。

为进一步增强基准的专业性、代表性和产业适用性,中国信通院现面向社会公开征集测试任务。这一举措意味着,无论是科研机构、企业开发者还是个人开发者,均可参与 " 方升 " 智能体基准测试任务的建设,共同推动智能体评估标准的发展与完善。
在智能体技术快速迭代、应用场景不断拓展的当下,中国信通院 " 方升 " 智能体基准测试任务征集工作的启动,将为行业提供一个更加科学、全面的评估体系,推动智能体从 " 能说会道 " 走向 " 能干实事 "。
版权所有,未经许可不得转载


登录后才可以发布评论哦
打开小程序可以发布评论哦