星途科讯 20分钟前
Cognition发布2.8万亿参数SWE-2:成本大幅优于竞品,暂不开放权重
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

Cognition 正式推出 SWE-2 模型,该模型以 Kimi K3 为底座,叠加 Cognition 后训练技术,总参数量达 2.8 万亿,采用 MoE 架构,每 Token 激活 1040 亿参数。此举标志着 Cognition 首次将强化学习扩展至万亿级参数规模。基础模型已针对智能体编码任务进行大量强化学习优化,后续训练在多数基准测试中提升了 5 至 6 个百分点。

技术架构与效率优化

在推理栈方面,SWE-2 采用 NVFP4 和 FP8 内核进行 MoE 推理,配合量化感知训练,其中 MLA 层的键、查询、值及得分计算均使用 FP8 格式。通过 SpecForge 重新训练的草稿模型使接受长度延长 15%,预填充延迟优化让每张 GPU 的每分钟处理令牌数(TPM)及每次请求的每秒生成令牌数提升 10% 至 20%,但首 Token 延迟(TTFT)略有增加。

效率层级数据显示,SWE-2 在中等、高、最大模式下的单次运行平均步数分别为 53 步、80 步和 98 步,显著低于 SWE-1.7 的 127 步。在中等模式下,其 FrontierCode 得分高于 SWE-1.7,交互轮次减少 58%,平均成本降低 81%,并首次实现真实代码编辑的中位步数为第 18 步(SWE-1.7 为第 48 步)。

基准表现与成本优势

根据 Cognition 自报数据,SWE-2 在 FrontierCode 1.1 Main 得分为 50.0,DeepSWE 1.1 得分为 73.0,Terminal-Bench 2.1 得分为 92.8(公开表格最高分),Terminal-Bench 4.0 得分为 27.3。亮点在于,其 FrontierCode 得分仅落后 Claude Fable 5.1(50.9 分)1 分,低于 GPT-6 Astra(53.3 分)3.3 分,但成本比 Fable 5.1 低 64%,仅为 Astra 的四分之一。短板体现在 Terminal-Bench 4.0,27.3 分大幅落后于 Fable 5.1(55.8 分)和 GPT-6 Astra(57.9 分),显示在长周期智能体工作场景下与前沿水平仍有差距。

部署情况与数据说明

SWE-2 为专有权重,不支持本地部署,Cognition 未发布权重文件,因此无法下载或等待量化版本。目前该模型已在 Devin Desktop 和 CLI 版本中上线,Devin Web 和 Fusion 版本将逐步推出。由于未提供单 Token API 定价,上述成本对比构成其定价参考,而非标准费率卡。文中所有数据均来自 Cognition 官方,尚待独立验证。

【星途科讯 图文丨欧阳布布 首发于 ZAKER 科技,转载请注明出处】

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

astra fusion kimi gpu
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论