日前,百度文心助手任务 Agent(Orion Mission Mode)以 94.6% 的综合成功率、94.4% 的平均得分,在全球工程向 AI 智能体评测榜单 PinchBench v2 中荣登榜首。
在 148 项真实任务的综合评测中,文心助手任务 Agent 超越 Anthropic Claude Opus 4.8-fast、阿里千问 Qwen3.7-max、英伟达 Nemotron-3 Ultra、OpenAI GPT-5.6-luna 等海内外主流大模型。 此次 PinchBench v2 榜单以 148 项真实企业自动化任务为核心测试标准,覆盖创意内容、写作、数据分析、研究知识、代码运维等多维场景。据榜单数据显示,文心助手任务 Agent 在创意内容、写作内容等多个赛道获得领先的评测认证,工具调用、多步骤任务自主规划与长程任务执行能力表现突出。此次评测流程,百度 AI 搜索团队以 Orion Mission Mode 的名称,在 GitHub 上开源。
据悉,文心助手任务 Agent 依托百度搜索二十余年技术积累与百度搜索猎户座 AI 引擎的多智能体框架能力,为智能体应用开发提供了自主可控、高性能的国产化底层模型底座。目前,该核心技术已全面应用于百度 APP 及文心助手。
1、猎云网原创文章未经授权转载必究,如需转载请联系官方微信号进行授权。
2、转载时须在文章头部明确注明出处、保留官方微信、作者和原文超链接。如转自猎云网(微信号:lieyunjingxuan
)字样。
3、猎云网报道中所涉及的融资金额均由创业公司提供,仅供参考,猎云网不对真实性背书。
4、联系猎云,请加微信号:jinjilei


登录后才可以发布评论哦
打开小程序可以发布评论哦