点击 Tech 星球 > 点击右上角 " ··· " > 设为星标

Tech 星球(微信 ID:tech618)
文 | 华卫
封面来源 | 豆包 AI
今天(9 月 4 日),OpenAI 发布新一代前沿模型 GPT-6 Astra,并直接甩下一句:Welcome to the AGI era(欢迎来到 AGI 时代)。
最近的大模型行业,新模型的出现简直像坐火箭。9 月仅仅过去了四天,就有四家海外巨头轮番上阵。第一天,Anthropic 宣布推出 Claude Fable 5.1 和 Mythos 5.1。第二天,谷歌发布了 Gemini 3.8 Flash 和专攻网络安全的 Gemini 3.8 Flash Cyber,Meta 祭出 Muse Spark 1.3。
国内市场的发布节奏同样快得惊人。上一周,三家国内开源模型厂商发了新模型,阿里千问 Qwen3.8-Flash、智谱 GLM-5.3-Flash 和腾讯混元 Hy4 preview 都上线了。再往前推两周,DeepSeek V4 Pro、Grok 4.6、谷歌 Gemini 3.7 Flash、智谱 GLM-5.3 接连在 48 小时内亮相。
Benchmark 排行榜上,最强模型的保质期越来越短了,从登顶榜首到被超越,现在根本撑不过一周。模型厂商似乎要完成某种 KPI 一样,扎堆上线," 周抛 ",正在成为大模型的新常态。

大模型厂商,已经等不起了
在最新模型的发布中,OpenAI 和谷歌都不约而同地提到 RSI 机制上的巨大飞跃。该机制的核心是 AI 参与乃至改进自身研发流程、从而持续缩短模型迭代周期,全称是 Recursive Self-Improvement(递归式自我改进)。
OpenAI 强调,Astra 是第一款由前代模型深度参与训练监督的旗舰产品。谷歌 DeepMind 大牛姚顺宇表示,Gemini 3.8 Flash 对 RSI 来说是一次巨大飞跃。
作为本轮模型发版加速的重要推手,RSI 即将开启模型发布的新周期,可以预见模型进化的速度将会更快,周抛马上要成为过去式。
除了用模型加速自身的内部研究,另一个重要原因是,大模型研发正在从一次 " 造神 " 的大工程,变成越来越标准化的 " 流水线 " 式训练。
过去,新模型发布是一件很重的事情。无论是数据、训练周期还是算力,都需要巨额投入,研发周期动辄几个月甚至更久。模型厂商也不会轻易发版,一旦推出新模型,就意味着一次重大的 " 代际升级 ",可能要被讨论上几个月。
但现在,这套节奏正在被打破。
基础模型训练方法越来越成熟,后训练、强化学习、推理优化、数据处理等环节也越来越工程化。一个新模型不一定意味着从头训练一个完全不同的巨型模型,而能够基于已有模型底座,通过强化推理、代码、Agent、视觉等特定能力,或者进一步优化速度、成本和上下文能力,快速推出一个新版本。
模型的 " 代际 " 概念也因此开始变得模糊。新模型不一定意味着一次彻底的技术跃迁,更像软件产品小版本迭代:能力有提升,体验有变化,价格可能更低,但底层架构未必发生翻天覆地的变化。
此前,智谱就明确表示,GLM-5.3 和 5.2 使用同一个基础模型,所有提升全部来自后训练。阿里通义团队在发布 Qwen3.8-Flash-Next 的开源权重时透露,Next 新架构将是全新一代 Qwen4 系列模型的雏形。
还有一个变化是,模型厂商开始越来越频繁地发布 " 小版本 " 和 " 专用版本 "。他们的发版目标,从追求 " 做出一个最强模型 ",拆成推出 " 瞄准某个具体需求而且可以马上用起来 " 的专项版本。
这也是为什么今年 "Flash" 越来越密集地出现在各家模型产品线中。它们并不一定追求在所有指标上击败旗舰模型,而是把速度、成本、推理能力或者特定场景做到更极。并且,Flash 参数规模相对较小,修改和重新训练模型所消耗的算力更低,进一步降低了模型发布的门槛和周期。
与此同时,开源模型 " 闪电战 " 般的密集发布,正在把大模型竞争拉进一个更加实时的维度。对开源阵营来说,它们甚至不一定需要在每次发布中都全面击败最强模型,只需要不断缩短与其的距离。而这种持续追赶,本身就是一种竞争压力。
过去,大模型行业 " 分工 " 清晰,开源模型 " 卷速度 ",闭源巨头则更习惯集中资源做长周期研发,每次发布就是一次重磅升级。但现在,连过去最有能力 " 憋大招 " 的闭源巨头,也开始运行这套高频迭代的发布规则。从 Gemini 3.7 Flash 到 3.8 Flash,谷歌只用了 3 周。
模型发布的常规周期一旦缩短,整个行业的 " 时间感 " 都会改变。以前半年不更新,市场觉得正常。现在几周不更新,大家就会开始怀疑:" 你是不是掉队了 "。如今,模型的更新速度本身,已经开始成为竞争壁垒了。

没有绝对 TOP,模型越来越像 " 快消品 "
如果说 2023 年的大模型是 " 奢侈品 ",稀缺、昂贵、少数巨头独占。那么,2026 年的模型市场,正在变成一场 " 快消品的盛宴 "。
现在," 绝对领先 " 已经不适用于这个行业了。Benchmark 排行榜越来越像模型的 " 实时股价 "。" 谁是第一?" 不再是用户口中讨论的焦点,大家只关心: " 今天哪个模型最好用?" 换个任务场景选择可能就不同了。
OpenAI 刚发的 GPT-6 Astra 就是一个典型例子。在其内部测试中,GPT-6 Astra 以同样的标准版定价,在多项基准都拿到了高于 Claude Fable 5.1 的得分。但在 " 人类最后的考试 " 测试中,Astra 使用工具的得分为 57.2%,低于 Sol 的 65.0% 和 Claude Fable 5.1 的 63.8%。在第三方机构 Artificial Analysis 的横测中,Astra 的 Coding Agent Index 比 Fable 5.1 低 3 分。
模型越来越多,能力差距收窄了。每家都有自己的 " 第一 ",没有谁一骑绝尘。
价格也被打下来了," 最强模型 " 越来越不值钱。 Anthropic 刚发布的 Fable 5.1,缓存读取费用下调 75%,每百万 token 只需 0.25 美元。对于常规任务来说,整体的成本比 Fable 5 降低了约 25%;大量使用 AI 智能体的复杂任务能够节省的成本更多,最高能够达到 45%。
8 月,OpenAI 还发帖宣布:未来三个月内,GPT-5.6 Sol 的 API 调用价格与超额信用额度全面下调超过 20%。数据服务商 Silicon Data 公开的最新数据显示,今年全球每百万 token 推理均价已从 5 月底的 2.04 美元跌至 8 月初的 1.16 美元,创年内新低。
更关键的是,各家模型正在主动降低切换的技术门槛,接入新模型不一定意味着从底层重写一套系统。腾讯最新发布的 Hy4 preview 支持 OpenAI Chat Completions、OpenAI Responses 以及 Anthropic Messages 三种 API 协议,Qwen 和智谱的 GLM-5.3 同样提供兼容 OpenAI Chat Completion 和 Anthropic Messages 规格的 API。
上下文长度也不再能 " 绑定 " 特定模型,现在有更多替代方案了。Gemini 3.7 和 3.8 Flash 都支持约 104.8 万 Token 输入上限,Hy4 采和 Qwen3.8-Flash 都提供了 1M Token 上下文窗口。
当然,这并不意味着所有用户真的会在实际任务中每周换一次模型。但需要注意的是,用户越来越没有理由对某一个模型保持长期忠诚。现在的大模型市场,品牌崇拜正在退场,取而代之的是一种 " 超市货架式 " 的随取随用,没有稀缺性、迭代速度贼快且切换无负担。

谁最焦虑,谁又在狂欢?
于是,一个很有意思的局面出现了:模型厂商越来越焦虑,开发者和普通用户却越来越开心。
当模型进入高频迭代,模型厂商几乎没有 " 喘息期 "。一次发布建立的领先优势,很快就可能被下一轮更新追上。它们不仅要做出比上一代更强的模型,还需持续证明自己没有落后。
但对于开发者和普通用户来说,感受却完全不同。模型发布越来越快,数量越来越多,他们反而越方便 " 货比三家 ",重要的是只有三个问题:好不好用、够不够便宜、能不能完成任务。
情况稍显棘手的,可能是那些把大模型深度嵌入业务流程的企业。模型越来越多之后,持续的模型评估、选择正在变成企业新的工程负担。不同模型在推理、代码、Agent、速度、价格等维度各有优劣,而模型又在持续更新,今天的最优解很可能很快被新的版本打破。
更麻烦的是,企业很难像普通用户一样 " 说换就换 "。企业已经围绕原有模型搭建了 Prompt、知识库、工具调用、Agent 工作流和评测体系,模型一旦更换,不仅是修改一个 API 参数,实际上可能很多业务流程与环节都需要重新测试和调优。
因此,在 B 端市场,大模型比拼的下一阶段,可能不只是模型厂商之间争夺用户,而是围绕 " 谁能更低成本地选择、切换和组合模型 " 展开,这或将成为新的竞争力。
今天的行业 TOP,只属于今天。因为下一代模型,可能下周就来了。
" 周抛 " 改变的,或许不只是模型发布的频率,而是大模型行业的竞争逻辑:" 领先一次 " 远远不够,真正决定胜负的,是谁能更快进入下一轮。

欢迎按指引星标 Tech 星球
第一时间接收文章更新



加入交流群 & 内容转载 & 合作相关
Tech 星球小助手 | 微信:miniworld007


