代码浪潮记 9小时前
DeepSeek轻量版逆袭,代码能力反超Pro
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

DeepSeek 在 7 月 31 日低调放出 V4-Flash 正式版公测,模型参数没变,但 Agent 和代码能力突飞猛涨,多项基准甚至反超了自家更大的 Pro 预览版。

一、更新核心:后训练让轻量版 " 逆袭 "

发布时间:7 月 31 日下午,DeepSeek 在 API 文档更新日志中挂出通知,V4-Flash 正式版(V4-Flash-0731)上线公测。

模型参数:采用 MoE 架构,总参数 2840 亿、激活参数 130 亿,与之前的预览版完全一致。

能力飞跃:仅通过重新进行后训练(post-training),重点强化了智能体(Agent)与工具调用方向,使代码修改、多步骤任务执行等能力大幅提升。

基准成绩:在 TerminalBench、Cybergym、Toolathlon 等九项 Agent 与代码类基准测试中,全部超过 1.6 万亿总参数的 V4-Pro 预览版。其中在 DeepSWE 基准上分差达 41.6 分,在 ALE 基准上与顶级模型 Claude Opus 4.8 仅差半分。

二、技术逻辑:告别单纯堆参数

Scaling Law 再受挑战:2026 年以来,行业重回 " 万亿参数时代 ",阿里 Qwen 3.8-Max 总参数达 2.4 万亿,月之暗面 Kimi K3 达 2.8 万亿。而 DeepSeek 此次证明,后训练优化同样能带来质变,无需大幅增加算力。

自研工具:基准测试采用了自研的 DeepSeek Harness 极简模式跑分,类似 Codex 工具,并加大了智能体方向的专家训练力度。

原生适配:首次原生支持 Responses API 格式,并针对 Codex 进行深度适配,方便开发者接入 Agent 和 AI 编程场景。

三、定价与市场影响

超低价格:每百万 tokens 输入仅 0.14 美元,输出 0.28 美元,远低于同类模型。国产模型正将前沿 Agent 能力变为 " 所有人都用得起的基建 "。

仅限 API:此次更新仅针对 API 接口,App 和网页端暂未调整。V4-Pro 正式版预计 8 月初完成接入。

行业点评:分析认为,AI 竞争正从 " 谁参数多 " 转向 " 谁在真实场景中又好又便宜地干活 "。

精选参考来源 查看全部

本文由 AI 生成

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai kimi 阿里 编程 基建
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论