IT之家 17小时前
Kimi K3模型AI智能体知识工作跑分仅次于Claude Fable 5
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

IT 之家 7 月 24 日消息,Artificial Analysis 于 7 月 22 日更新 AI 智能体知识工作基准 AA-Briefcase,显示 Kimi K3 模型斩获 1543 分,超过 GPT-5.6 Sol(1501 分),仅次于 Claude Fable 5 模型(1574 分)。

IT 之家注:AA-Briefcase 是独立 AI 评测机构 Artificial Analysis 于 2026 年 6 月推出的全新前沿 AI 智能体(Agent)知识工作基准测试。

它专为评估 AI 在处理长周期、高复杂度真实业务中的表现而设计,模拟企业中真实且混乱的办公环境,测试数据科学、产品管理、企业战略等场景,处理海量碎片化上下文(包括 25000+ 条 Slack 消息、3500+ 封电子邮件、会议纪要和财务报表等),并要求生成 Excel 财务模型、董事会汇报 PPT 等实际的商务交付物。

根据最新跑分结果显示,Kimi K3 模型在 AA-Briefcase 上的跑分达到 1543 分,仅次于 Claude Fable 5(1574 分),超过 GPT-5.6 Sol ( 最高 1501 ) 、Claude Sonnet 5 ( 最高 1388 ) 和 Claude Opus 4.8 ( 最高 1347 ) 。相比较而言 Kimi K2.6 模型在榜单上的成绩为 816 分。

延伸阅读

Kimi K3 模型由月之暗面(Moonshot AI)于 2026 年 7 月 16 日正式上线,是其迄今为止最强的旗舰模型,拥有 2.8 万亿参数和 100 万 Tokens 的上下文窗口,尤其擅长编程、游戏 / 3D 与知识类任务。

在编程能力方面,Kimi K3 在 Frontend Code Arena 基准测试中曾以 1679 分超越 Claude Fable 5 登顶,在品牌营销、数据分析等七个前端领域中的六个位居第一。

Kimi K3 模型采用按量计费,每 100 万 Tokens 的输入费用在缓存命中时为 2 元,未命中时为 20 元,输出费用为 100 元。

近期有报道称,微软正在内部测试 Kimi K3 模型,并评估将其部分接入 Copilot AI 助手的可行性,以降低推理成本。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai 编程 it之家 数据分析 阅读
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论