
Cognition 正式推出 SWE-2 模型,该模型以 Kimi K3 为底座,叠加 Cognition 后训练技术,总参数量达 2.8 万亿,采用 MoE 架构,每 Token 激活 1040 亿参数。此举标志着 Cognition 首次将强化学习扩展至万亿级参数规模。基础模型已针对智能体编码任务进行大量强化学习优化,后续训练在多数基准测试中提升了 5 至 6 个百分点。
技术架构与效率优化
在推理栈方面,SWE-2 采用 NVFP4 和 FP8 内核进行 MoE 推理,配合量化感知训练,其中 MLA 层的键、查询、值及得分计算均使用 FP8 格式。通过 SpecForge 重新训练的草稿模型使接受长度延长 15%,预填充延迟优化让每张 GPU 的每分钟处理令牌数(TPM)及每次请求的每秒生成令牌数提升 10% 至 20%,但首 Token 延迟(TTFT)略有增加。
效率层级数据显示,SWE-2 在中等、高、最大模式下的单次运行平均步数分别为 53 步、80 步和 98 步,显著低于 SWE-1.7 的 127 步。在中等模式下,其 FrontierCode 得分高于 SWE-1.7,交互轮次减少 58%,平均成本降低 81%,并首次实现真实代码编辑的中位步数为第 18 步(SWE-1.7 为第 48 步)。
基准表现与成本优势
根据 Cognition 自报数据,SWE-2 在 FrontierCode 1.1 Main 得分为 50.0,DeepSWE 1.1 得分为 73.0,Terminal-Bench 2.1 得分为 92.8(公开表格最高分),Terminal-Bench 4.0 得分为 27.3。亮点在于,其 FrontierCode 得分仅落后 Claude Fable 5.1(50.9 分)1 分,低于 GPT-6 Astra(53.3 分)3.3 分,但成本比 Fable 5.1 低 64%,仅为 Astra 的四分之一。短板体现在 Terminal-Bench 4.0,27.3 分大幅落后于 Fable 5.1(55.8 分)和 GPT-6 Astra(57.9 分),显示在长周期智能体工作场景下与前沿水平仍有差距。
部署情况与数据说明
SWE-2 为专有权重,不支持本地部署,Cognition 未发布权重文件,因此无法下载或等待量化版本。目前该模型已在 Devin Desktop 和 CLI 版本中上线,Devin Web 和 Fusion 版本将逐步推出。由于未提供单 Token API 定价,上述成本对比构成其定价参考,而非标准费率卡。文中所有数据均来自 Cognition 官方,尚待独立验证。
【星途科讯 图文丨欧阳布布 首发于 ZAKER 科技,转载请注明出处】


