编辑 | 言征
Kimi K3 发布之后,很多人的第一反应都是这个数字:3 万亿。
作为全球首个开源 3 万亿级大模型(总参数 2.8 万亿),这个数字足够震撼。从 K2 的万亿参数,到今天的 K3,中国开源模型再次刷新了模型规模的上限,海内外不少网友惊呼,这款开源模型性能足以替代昂贵的 Claude Fable 5 和 GPT 5.6 Sol。
硅谷知名开发者平台 Vercel 直接在 X 上晒出了一项 Agent 测评的结果:Kimi K3 在 Web 工程基准领先于所有模型,包括 Fable。
甚至有歪果仁感叹,中国不到 3 个月就超过了 Fable!
但如果今天只讨论参数或者超越某款前沿模型,反而容易错过 Kimi K3 真正想表达的东西。
过去几年,大模型行业一直沿着一条熟悉的路径前进:参数越来越大、Benchmark 越来越高、模型越来越聪明。
进入 2026 年之后,一个新的变化开始出现。
Anthropic 持续强化长程 Agent,OpenAI 不断扩展产品生态,Google 把更多能力押注在多模态与世界模型。海内外头部模型的发展方向,开始出现明显分化。
而 Kimi K3,则给出了 Moonshot 自己的答案。
继续相信 Scaling Law,继续相信预训练,同时让模型真正走长程 Agent,让大模型参与自身的构建与进化。
这也是为什么我认为,K3 真正值得关注的,并不是 3 万亿参数,而是它背后释放出的技术路线。
如果把时间拉回两年前,行业讨论最多的问题是:Scaling Law 到底还成不成立?
随着训练成本越来越高,不少人认为,大模型的发展重点应该转向推理、Agent 或后训练优化,而不是继续堆参数。
但 Kimi K3 给出的答案非常明确。
他们仍然相信,更大的预训练模型,是未来智能能力的基础。2.8 万亿参数,并不仅仅是刷新纪录。它意味着 Moonshot 仍然愿意把资源投入最难、周期最长、风险最高的预训练。
注:在过去 12 个月中的 9 个月里,Kimi 模型都保持着开源模型的规模上限。
原因其实并不复杂。很多能力,并不是通过后训练 " 调 " 出来的,而是在模型规模跨过某个节点之后自然涌现出来的。
从长上下文,到复杂推理,再到软件工程能力,越来越多能力开始依赖模型本身拥有足够高的知识密度和表达能力。
这也是为什么,目前全球真正能够把模型规模推到万亿参数以上的团队,依然屈指可数;能够继续向 2 万亿、3 万亿推进的,更是凤毛麟角。
从 K2 到 K2.5,再到今天的 K3,Moonshot 一直在做同一件事情:不断提高开源模型能力的天花板。
如果仔细看 Kimi K3 官方公布的能力,你会发现一个很有意思的现象。
官方几乎没有把重点放在聊天体验,而是反复强调几个关键词:
100 万 Token 上下文、Long-horizon Coding、Agent、多模态工程。
这些能力,其实都在服务同一件事情。
让模型能够持续完成一项复杂工作,而不是回答一个问题。
过去,大模型完成的是一个对话 Prompt。今天,大模型开始完成一个项目。
举个简单的例子。
写一个登录页面,大多数模型都能做到。但如果把整个代码仓库交给模型,让它理解项目结构、定位 Bug、修改代码、运行测试、分析日志,再根据反馈不断调整方案,并连续工作几十个小时,这已经不再是 " 写代码 ",而是真正参与软件工程。
因此,100 万 Token 的意义,也不只是一次能放进更多文本。整个代码仓库、几十篇论文、历史日志、设计文档,都可以成为同一个任务的上下文。对于 Agent 来说,超长上下文影响的不只是体验升级,而是工作能力本身。
这里,小编还做两个实测,一个是剧本杀游戏网站,提出了三个非常苛刻的要求:
1、 K3 必须严禁失忆,须把每一个技术决策、每一次踩坑记录、每一段文件路径,都当作 " 未完结的思考 " 保留在对话上下文中。2、分阶段交付给我,而且只能我同意之后才能继续。3、每阶段必须输出 " 连续性自检报告 " 格式,以便我监控你的记忆健康度。
没想到的是,这样一个变态的 token 产出要求,K3 很聪明地分析了挑战点,不仅第一阶段就给出了长达近 8000 字的剧本设定,还在后续自我分析了记忆残存率。
第二个案例则是网页版的 3D 单机游戏《仙剑奇侠传 1》,可以看出剧情环节怀旧程度很高。每个章节都是满满的回忆杀,更关键的是,全程只花了我一个小时,就完成了本来需要 7 天的开发工作。
不过这里帮各位提个醒, K3 的长时程任务完成度很高,但要注意不要贪杯,因为 token 消耗也是更快的版本,但 token 花得真值,这一点毋庸置疑。
说到这里,多提一嘴,由于全球用户的疯狂涌入,Kimi 不得不在昨天做了一个很坦承的公告:由于过去 48 小时内,需求已经逼近公司当前容量的极限。为了保护现有订阅用户的体验,将暂停新订阅。
这一保证用户体验优先的举动与 Anthropic 此前频繁的限流举措形成了对比,赢得了全球用户的好感:很透明,别的公司应该学一学。
如果说长程 Agent 展现的是 K3 的工作能力,那么官方公布的另一个案例,则透露出 K3 更大的野心。
K3 开始参与 K3 自己的研发。
Kimi 官方放出了极具代表性的案例:K3 设计了一款高性能芯片,用于运行基于 K3 自身架构构建的 nano 模型。
在连续 48 小时的自主 Agent 运行中,K3 基于开源 EDA 工具和 Nangate 45nm 工艺库,独立完成了芯片的构建、优化与验证。
这个案例真正恐怖的地方,并不在于它优化了多少性能。而在于,大模型开始从 " 帮助人开发软件 ",迈向" 帮助人开发下一代大模型 "。
过去几年,我们更多看到的是 AI 提升程序员效率。而现在,一个新的方向开始出现:AI 开始参与 AI 本身的研发。从优化模型架构,到分析训练实验,再到辅助算法迭代,大模型正在逐渐进入 AI 科研工作流。
这或许也是 Kimi K3 发布中最容易被忽略,却最值得关注的一点。它释放出的信号并不是 " 模型已经能够自主进化 ",而是模型已经具备参与自身迭代和优化工作的能力。
从某种意义上说,这也是大模型迈向下一阶段的重要一步。
很多人注意到,Kimi K3 采用了全新的 Kimi Delta Attention(KDA) 和 Attention Residuals 架构。
之前,很多报道都介绍了它们是什么。但我觉得,更值得讨论的是:为什么 Kimi 要做这些创新?
答案其实只有一句话:为了让数万亿级别的模型真正能涌现出来更强性能。而这里,更强的性能体现,不管是各种真实世界任务,还是 AI 参与 AI 研发,都要面对这三个技术问题:
模型越来越深,上下文越来越长,信息在推理过程中很容易不断衰减。
一次聊天问题不大。但如果一个 Agent 连续工作十几个小时,模型在第 300 步忘记第 20 步的信息,整个任务就可能失败。
而 Kimi 就是敢于向这些硬骨头发起攻坚。KDA 解决的是长序列效率。Attention Residuals 解决的是长程信息传递。它们共同服务的目标,并不是让参数继续增长,而是让 3 万亿参数真正转化成现实生产力。
这也就不难理解,K3 的官方案例几乎全部围绕长程 Agent、软件工程、多模态工作流。
还有一个细节,很多人没有注意到。Kimi K3 并没有在发布当天立即开放模型权重,而是宣布将在 7 月 27 日前正式开源。
就在这几天,海外开发者社区出现了不少讨论。不少人担心,中国对于先进模型的监管是否会影响未来开源模型的发布节奏。这种讨论本身,其实已经说明了一件事情。
过去,中国模型努力追赶海外最先进的大模型。今天,全球开发者开始担心,中国最先进的开源模型还能不能继续开放。
这种身份变化,本身就是行业格局变化的体现。从 DeepSeek,到 Qwen,再到今天的 Kimi,中国团队已经成为全球开源生态最重要的参与者之一。
而 K3 的意义,也不仅仅是一款新的模型。它意味着,中国团队再一次把全球开源超大模型的竞争,真正带到了新的高度。
此外,Anthropic 更是在 K3 发布 24 小时内就被倒逼发布了 " Fable 5 放开访问令 ",不止 Max 和团队高级套餐,Pro 和 Team 标准用户都可以访问。
如果说 K2 证明了,中国能够做出世界级的开源大模型。那么 K2.5 证明了,中国开始定义开源模型的新标准。而 K3,则第一次让中国团队站到了全球超大模型竞争的牌桌中央。
诚然,Kimi 很大方地宣布它仍然没有超越 Claude Fable 5,也没有刻意喊出 " 世界第一 "。但它释放出的信号已经足够清晰。
Kimi 用 K3 向世界证明了四件事:
一,预训练的 Scaling Law 依旧有效;
二、未来大模型竞争,比拼的不再只是参数,而是谁能持续完成真实世界里的长时程复杂工作;
三、Agent 不只是模型发展重点方向,让模型自己参与自己的构建,将大大加快 AI 世界的进程;
四、开源模型的竞争,中国团队已经不再只是追赶,而是开始主动参与定义下一代模型的发展方向。
参考链接:
https://mp.weixin.qq.com/s/V4xhEIy8xDXSMDPrPkmUAQ
https://x.com/jose_regoterol/status/2078465641216933951
https://x.com/chrszegedy/status/2078909341575631017
——好文链接——
Prompt 过时了!Claude Code 创始人:一问一答已经成为 Agent 的新瓶颈,软件开发已经连跳两级


登录后才可以发布评论哦
打开小程序可以发布评论哦