钛媒体 19小时前
实测:DeepSeek追上Kimi了吗?
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

文 | AIX 财经,作者 | 雷晶,编辑 | 金玙璠

盼望着,盼望着,DeepSeek-V4-Pro 正式版终于来了。

这次发布,过程还有点曲折。8 月 12 日晚,DeepSeek 官方 API 定价页悄然发生变化,DeepSeek-V4-Pro 对应版本已经更新为 DeepSeek-V4-Pro-0813,新模型先在 API 端静默上线了。

8 月 13 日下午,DeepSeek 官网的发布通知以及开放平台公告被撤回,不过模型仍然显示在模型与价格页面中。到了 13 日晚间,DeepSeek 重新发布公告,确认正式版已同步登陆 APP、网页端和 API。

正式版继续往长任务和 Agent 方向走。它延续了 1M 上下文、384K 最大输出等规格,同时支持非思考和思考模式,思考模式默认开启。1M 上下文可以一次塞进更大的代码库和文档,384K 最大输出则给连续编程、复杂 Agent 任务留下了更大的执行空间。

除此之外,正式版还新增了 low、high、max 三档思考强度,并原生支持 Responses   API。对应到官方公布的基准成绩上,它的重点能力也比较明确,主要集中在 Coding、Agent、工具调用和复杂任务执行。

DeepSeek 这次也涨价了。从 8 月 17 日开始,DeepSeek  API将采用峰谷定价:每天 9:00-12:00、14:00-18:00 为高峰时段,其余为空闲时段,空闲价格为高峰的一半。以 DeepSeek-V4-Pro 为例,空闲时段缓存未命中输入、输出价格将从目前的 3 元、6 元涨至 4.5 元和 13.5 元,高峰时段则达到 9 元和 27 元。

配置摆在这里,价格也涨了,那实际能力到底如何呢?

要判断 DeepSeek-V4-Pro 处在什么水平,Kimi K3 是一个很合适的参照物。Kimi K3 是上个月发布的旗舰模型,在 Coding 和 Agent 相关榜单上表现突出,且两款模型瞄准的能力区间高度重合。我们具体来看一下基准成绩的对比。

DeepSeek-V4-Pro 正式版 VS Kimi K3 跑分对比图

从上图可以看出,两款模型没有出现谁把谁完全甩开的情况,而是各自守住了几块优势。Kimi K3 更占优的项目,大多集中在长程软件工程和连续任务执行。DeepSeek-V4-Pro 正式版则在自动化、安全以及部分高难任务上更占优势。

跑分只能说明一部分问题。真正放进具体任务里,两款模型谁更会干活?我们选了四类任务,用同一套提示词分别交给两款模型,看看谁的表现更好。

不过,需要说明的是,我们是在 DeepSeek-V4-Pro 正式版尚未上线 App 和网页端时开始测试的,使用方法是将它接入 Codex 使用;Kimi K3 则直接在 Kimi Work 中调用。这意味着在编程、网页生成和文件操作等任务里,最终表现除了模型本身,也可能受到工具链和运行环境影响。另外,本次测试均为单次生成结果,模型输出存在一定随机性,结果仅供参考。

接下来,我们一起看看它们的实际表现。

01. 内容创作:DeepSeek 更会讲故事,Kimi 更会做报告

我们先从最容易暴露模型 " 表达习惯 " 的内容创作开始。

我们设计了两道题:一道考故事续写,看模型能不能理解人物、延续叙事;另一道考行业报告,看它能不能从大量信息里抓住重点、组织观点。

我们先让两款模型为近期爆火的 AI 漫剧《被裁掉的女孩》续写第二季,从第一季女主角方桃子结束巴黎时装周、回到上南城的第二天开始,写一个 1000 字左右的故事。要求延续第一季的现实风格,不走一路开挂的爽文路线,而是继续讨论行业规则、舆论压力和自我价值等更现实的问题。

写故事对大模型来说不算难,难的是不暴露 "AI 味 "。从结果来看,两款模型都没有完全逃过这个问题。还需要说明的是,即便做了简单的介绍,它们对具体的人物依旧不了解,给出的故事人物和原剧设定有出入。

先来看 DeepSeek-V4-Pro 正式版的成品,有 "AI 味 " 但至少故事线是顺的。

DeepSeek-V4-Pro 正式版生成的故事

Kimi K3 的问题更明显,它没有完全分清 " 背景资料 " 和 " 故事正文 "。我们在提示词中简单回顾第一季,只是为了帮助模型理解人物和前情。结果 Kimi K3 在故事里写了几句类似 " 第一季里陪她熬过来的助理小满 " 的句子,正常的续集不会突然站在观众视角提醒这是第一季的人物和情节,很容易出戏,也让整篇故事的衔接不够流畅。

Kimi K3 生成的故事

接着,我们把内容创作从文学拉回工作场景,让它们分别写一份 2026 年 AI 编程工具行业竞争格局分析报告。

DeepSeek-V4-Pro 正式版给出的框架比较清楚。它按照行业演变、全球格局、中国市场等维度展开,也会结合公司案例和数据支撑判断。不过,整体内容偏少,对头部产品竞争关系、市场变化等问题点到了但没有进一步展开。

Kimi K3 则明显更 " 能搜罗 "。它不仅整理了市场规模、采用率、国内外市场份额、产品定价等信息,还通过大量表格把不同公司和产品放在一起比较,呈现上更直观。论证也比较有条理,结尾还附上了信息来源。

这一轮,它们各赢一题。DeepSeek-V4-Pro 正式版更会把故事讲顺,Kimi K3 则更会收集和整理信息

02. 编程:DeepSeek 修改快,Kimi 还原准

接下来,进入两款模型都很受关注的编程场景。

我们先从最常规的前端网页开始,让它们做一个 " 电影选片器 "。网页需要内置至少 24 部经典电影,支持按类型和评分筛选,再通过 " 随机选一部 " 不断抽选。这道题本质上是前端综合题,主要考察模型能不能把数据、筛选逻辑、交互和视觉效果装进一个HTML文件。

Kimi K3 生成的电影网页

两款模型交出来的结果相当接近。它们都选择了深色背景,把筛选条件放在页面上方,中央用电影卡片承载抽选结果,类型筛选、评分区间、" 换一部 " 等核心功能也都正常实现。

DeepSeek-V4-Pro 正式版生成的电影网页

DeepSeek-V4-Pro 正式版的问题出在一个小细节。它在电影卡片中央加入了胶片图标,本意可能是为了增强氛围,但在部分加载情况下,图标会与文字发生重叠,影响观感。

这一题差距不大,于是我们把要求提高了一档,给它们两张艺术博物馆官网的截图,让它们据截图还原网页。这道题要求模型不仅要会写代码,还得先真正 " 看懂 " 页面。

艺术博物馆官网的截图

这一轮,差距明显拉开。DeepSeek-V4-Pro 正式版的成品 " 不能说一模一样,只能说毫不相关 ",它仅仅抓住了截图的色调,没有真正还原截图表达的内容。原图明明是艺术博物馆官网,它最终做出来的却是品牌官网。

DeepSeek-V4-Pro 正式版还原的网页

Kimi K3 的还原更准确。官网的整体结构、模块都保留下来,和原截图相当接近。比较明显的差别主要在图片素材,原截图的首页主视觉和部分页面使用了实景照片,Kimi K3 没有原始素材,用几何图形进行了替代。

Kimi K3 还原的网页

我们再把难度继续拉高,让它们做一款威尼斯运河快艇游戏。玩家要控制快艇,在倒计时结束前沿运河穿过桥洞,最终抵达码头。我们还要求加入晾衣绳、水面倒影等细节。

两款模型都交出了能玩的游戏,但侧重点不太一样。DeepSeek-V4-Pro 正式版把要求的运河两侧建筑、桥洞和晾衣绳等大部分元素都还原了,整体完成度不错。不过,它漏掉了一个细节,水面没有呈现建筑的倒影。此外,晾衣绳上的衣服虽然存在,但悬挂状态比较生硬,多少有一点 " 贴 " 上去的感觉。

我们随后临时加了一道题,把原本相对规整的桥洞改成交错分布,增加游戏难度。DeepSeek 大约 5 分钟完成修改,调整后的桥洞交错,且船不能直接穿墙而过,游戏逻辑基本成立。

DeepSeek-V4-Pro 正式版生成的游戏

Kimi K3 这一轮在视觉上更胜一筹。两侧建筑、晾晒的衣物处理得更自然,水面也能够看到房屋倒影,整个运河美感更强。尤其同样是 " 晾衣绳 ",两边都做了,但 Kimi K3 会进一步处理衣物悬挂状态,更像真实场景。此外,它还加入了快艇行驶、穿过桥洞得分等音效,游戏的沉浸感也更强。

我们同样要求它把桥洞改成交错分布。修改后的游戏能正常运行,碰撞逻辑也没有明显问题,不过这一轮它花了大约 10 分钟,是 DeepSeek-V4-Pro 正式版的两倍。

Kimi K3 生成的游戏

这一轮,两款模型在纯前端功能实现上的差距并不大,真正拉开差距的是复杂需求下的理解和执行方式。Kimi K3 更擅长还原视觉要求,成品细节也更完整;DeepSeek-V4-Pro 正式版虽然视觉表现稍逊,但二次修改速度更快,对明确指令的响应也更直接。

03. 视觉审美:DeepSeek 先卡壳,Kimi 一次 " 出片 "

接下来,我们再看看视觉审美。

我们让两款模型用 Three.js 还原水母湖,画面里要有大量金色水母随着光线迁徙,在碧绿海水中形成近似 " 金色星河 " 的效果;同时还要表现水面光束、丛林倒影、鱼群和不同远近层次的水母。这道题也在考验模型能不能理解一段偏文学化的视觉描述,再把 " 金色星河 "" 发光云团 " 这些抽象要求翻译成具体画面。

DeepSeek-V4-Pro 正式版先卡了几次。它半小时后交出的首个成品,打开页面一片空白;第一次修改后又出现渲染错误;直到第二次调整,场景才正常显示,但页面上仍留有一行渲染错误提醒。

DeepSeek-V4-Pro 正式版生成的水母湖

再具体看成品,它对视觉呈现的理解也偏了。我们想要的是金色水母密集分布,在水中形成像星河一样的发光云团。DeepSeek 的成品却在海水里铺了大量金色光点,而真正的水母则被处理成灰色椭圆状物体。结果 " 星光 " 有了," 金色水母群 " 这个主角反而没有体现。

它的整体色调也偏暗,更像置身较深的水底,看不出水面和阳光穿透的层次感。不过,它倒是体现了水下植物丛,背景环境铺得比较全。

Kimi K3 则花了大约 40 分钟,一次交出了可以正常运行的成品。它的理解更准确,画面里能看到密集的金色水母群,不同远近的水母形成明显层次,基本呈现出了要求的 " 金色星河 "。

Kimi K3 生成的水母湖

除了水母,画面中能看到鱼群、水面以及从上方洒下来的光束,整体风格也更偏写实,画面也更加精美。不过,我们要求水下能够看到植物,它的成品里基本没有呈现。

这一轮两者的差距依然比较明显。DeepSeek 视觉表现稍弱,首轮运行的稳定性也还有提升空间;Kimi 的理解和审美完成度更高。

04. 物理仿真:Kimi 跑通逻辑,DeepSeek 卡在穿模

最后,我们把难度拉满,进入一个更容易露馅的场景:物理仿真。

我们让它们用 Three.js 制作一个 " 鞭炮箱子 " 的 3D 连锁爆炸演示。100 个鞭炮落入箱中后,要完成点燃、爆炸、弹射和连锁引燃,同时处理碰撞、碎片和烟雾等效果。

这道题最重要的是物理逻辑和因果链能不能成立,鞭炮掉下来不能穿模、爆炸不能凭空发生,被冲击的鞭炮也要符合运动规律。

Kimi K3 大约用了 10 分钟就交出了结果,整体完成度比较高。鞭炮从上方落入透明箱子后,会留在箱体内部,没有明显穿模。点击 " 开始燃放 " 后,一个已经点燃的鞭炮从外部落入箱中,再逐渐引燃周围的鞭炮,整个过程至少在视觉上有清楚的因果关系。燃放的反应也比较写实,能看到明显的烟雾和气团效果。

Kimi K3 生成的 " 鞭炮箱子 "

单个引爆模式也和正常燃放做了区分,可以直接选择箱内某个鞭炮点燃,再从这个位置向周围触发连锁反应。这样一来,正常燃放是外部点火,单个引爆是局部触发,两条逻辑都连贯,更像一套完整的仿真演示。

DeepSeek-V4-Pro 正式版就要曲折得多,前后花了接近 40 分钟。首先出现了碰撞问题,鞭炮从上方落入箱子的过程中会直接穿过箱体,说明最基础的碰撞约束没有成立。到了点燃环节,箱内某个鞭炮突然冒出火星,开始连锁爆炸,缺少火源的过渡。它可能想展示爆炸后的气体形成的气团,但最终呈现像短暂白屏。而且整个爆炸过程明显卡顿,多次运行也没有明显改善。

DeepSeek-V4-Pro 正式版生成的 " 鞭炮箱子 "

单个引爆模式没有和正常燃放拉开明显差别,依旧是某个位置突然出现火星,随后进入同样的爆炸流程。按钮虽然有了,但对应的交互逻辑并没有真正做出区分。

这一轮,Kimi K3 明显更稳更能把物理规律落实到运行逻辑里DeepSeek-V4-Pro 正式版则在基础碰撞和因果链上掉了链子。

05. 结语

几轮测下来,我们发现,DeepSeek-V4-Pro 正式版在内容创作上叙事更顺;编程任务里,它的修改速度也更快。但在需要理解视觉信息的任务中,表现有待提升。截图还原、3D 视觉和物理仿真任务中,Kimi K3 对画面的理解更准确,成品完成度也更高。

所以,DeepSeek-V4-Pro 正式版依然能打,只是没有做到全面领先。考虑到它依然保持了较低的价格,性价比仍然突出。在旗舰模型里," 够用且便宜 " 本身就是竞争力。

一直以来,DeepSeek 最鲜明的标签,是用相对低的价格,提供足够强的模型能力。到了 DeepSeek-V4-Pro 正式版,这套逻辑发生了一些变化,API 将采用峰谷定价,虽然给开发者留下了通过错峰调用控制成本的空间,但 " 绝对低价 " 已经不再像过去那么突出。

模型表现之外,DeepSeek 背后的深度求索自己正在变 " 重 "。

6 月,深度求索启动大规模的公开招聘,提出希望各部门规模至少扩大一倍,岗位从算法研发扩展到产品、数据工程、运维等方向。与此同时,DeepSeek 官网招聘页面开始频繁出现 Agent Harness、Agent Infra 以及通用 Agent 数据产品经理等岗位。

8 月 13 日晚,DeepSeek Harness 开发者预览版正式开放测试,并同步以 MIT 协议开源。这套系统解决的是模型 " 怎么干活 " 的问题,模型、工具、存储等能力都可以通过插件自由组合。相比直接做一个面向用户的 Agent 产品,DeepSeek 选择先搭一套开放的 Agent 运行框架,把能力从模型层进一步延伸到 Agent 基础设施。

团队和产品都在扩张,背后也需要更多资金支撑。DeepSeek 过去长期依靠幻方体系提供资金,并一度拒绝外部融资。今年策略明显改变,6 月完成首次外部融资,规模超过 500 亿元,此后又继续推进新一轮融资。

所以,DeepSeek-V4-Pro 正式版之后,还有两个更值得观察的问题。

第一,涨价之后,DeepSeek 还能不能守住 " 高性价比 "。模型规模扩大、Agent 任务变长,都在增加算力消耗和成本压力。价格不再足够低之后,它需要靠更强的任务完成能力和更高的调用效率,证明自己依然 " 值 "。

第二,DeepSeek 能不能真正进入用户工作流目前的 Harness 仍主要面向开发者。接下来更关键的是,DeepSeek 会不会进一步推出面向普通用户或企业的 Agent 产品,把这些能力变成真正可用的工作流。只有走到这一步,DeepSeek 才能获得更直接的真实任务反馈,也才能把模型能力进一步转化成产品优势。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

kimi 高峰 元和 比图 编程
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论