(来源:每日经济新闻)
1/8,这是阶跃星辰为 Step 5 Preview 标出的成本注脚。
9 月 20 日,这家正处于赴港 IPO(首次公开募股)关键窗口的国产大模型公司,发布了新一代开源旗舰基座模型 Step 5 Preview。600B 总参数、27B 激活、稀疏 MoE 架构、100 万 Token(词元)上下文,在全球权威的 Artificial Analysis Intelligence Index(AA 综合智能指数)上拿到 44 分,位列全球开源模型前三。

图片来源:Artificial Analysis 网站
另一个阶跃星辰想要强调的数字是," 单任务成本仅为 Claude Opus 5 的 1/8"。在其看来," 这意味着,Step 5 Preview 在同样成本下获得更强智能,也让同等能力能以更低成本投入实际工作——进一步推动 AI 模型的帕累托前沿 "。
阶跃星辰表示,过去大模型 Scaling(规模化扩展)的核心,是用更多计算换取更强智能;但随着模型规模扩大、智能体任务复杂度提升,计算成本也在快速攀升。因此下一阶段模型 Scaling 的关键,是提升计算转化为智能的效率。
从今年 2 月发布的 Step 3.5 Flash、5 月上线的 Step 3.7 Flash 到 Step 5 Preview,阶跃星辰连续几代基座模型都在追问同一个问题:如何更高效地把计算转化为模型能力?
再一次押注模型效率,Step 5 Preview 这张答卷的成色究竟如何?"1/8 成本 " 的参照系是否经得起推敲?编程与金融两个战场的真实竞争力又在哪里?
效率的赌注:1/8 成本的成色与技术坐标
阶跃星辰表示,随着 Agent 从 " 回答问题 " 走向 " 完成任务 ",日常工作主力模型的评判标准不再只是单项能力足够强,而是要在能力、成本、效率和场景覆盖之间实现更好平衡,Step 5 Preview 正是围绕这种平衡而设计。
与近期引发广泛关注的 2.8 万亿参数模型 Kimi K3 相比,Step 5 Preview 用不到其五分之一的体量,在 AA 综合智能指数上拿到相同分数,在国产模型中得分仅次于 45 分的 Qwen3.8 Max 和 GLM-5.3。
" 这是一次教科书式的达标交卷,但离真正的代际跃迁还差一步。" 快思慢想研究院院长田丰在接受《每日经济新闻》记者采访时就阶跃星辰新一代基座模型的技术坐标解读道,国产大模型的密集更新节奏,正在把 " 分数领先 " 的含金量不断稀释,值钱的不再是某一次登榜,而是能不能在成本曲线和智能曲线之间,持续跑出比对手更陡的斜率。
从成本来看,"1/8 成本 " 的参照对象是目前市面上最贵的模型之一。如果对标 AA 测算口径下,参数规模相近的 DeepSeek 最新模型 V4.1 Flash 完成标准智能任务 0.27 美元的加权平均成本,Step 5 Preview 的成本达到 0.71 美元,处于更高水平。
在田丰看来,Step 5 Preview 并没有触及行业真正的成本地板。与此同时,推理硬件的性能提升速度,决定了全行业的推理成本大约每 12 到 18 个月就会有明显下降;若仅靠价格成本这一张牌,既容易被更大规模玩家的补贴战覆盖,也容易被行业整体成本下降自然填平,价格代差无法长久。
但价格战从来不是阶跃星辰真正想打的牌。成本优势是结果,效率是方法;低价标签的壁垒容易消散,但持续下压成本曲线的工程能力却不会。这才是阶跃星辰连续三代押注 " 效率 " 的真正意图:不是比谁今天更便宜,而是比谁能在同样的参数体量下,跑出更强大的智能表现。
所以,阶跃星辰把 " 效率 " 上升到战略层面,这不是某一代模型的特性,从 Step 3.5 Flash 到 Step 3.7 Flash 再到 Step 5 Preview,其反复在证明一件事:能在更小参数规模下,逼近更大参数模型的能力。
田丰认为,Step 3.5 Flash 总参数 196B、激活 11B,Step 3.7 Flash 总参数 198B、激活 11B,这两代参数规模几乎原地踏步,是阶跃星辰刻意压住规模、在同一体量下死磕效率打磨;Step 5 Preview 才是真正进行实质性参数扩容的产品。这一过程不是一路线性放大稀疏度的叙事,而是先在小规模上把效率打磨到位、验证清楚,再决定要不要扩容,体现出更谨慎的工程节奏。这比 " 越做越大 " 的路线多了一层自我约束,背后其实是整个行业规律的显现,不只是阶跃星辰一家的选择。
"Anthropic CEO(首席执行官)Dario Amodei 提出过一个判断:Scaling law(规模定律)本身没有失效,但‘把算力转化为智能’的转化效率,正在成为新的竞争维度。这跟摩尔定律的历史转折很像——当晶体管数量堆叠的边际效益递减,行业竞争的焦点从‘数量’转向‘每瓦性能’。阶跃只是在这条曲线上跑得比较早、比较坚决的企业,方向是行业的必然,节奏是阶跃自己的选择。" 田丰指出,Step 5 Preview 的发布不是一次改变竞争格局的跃迁,而是阶跃星辰在效率这条自己选定的赛道上又往前跑了一步。
场景的考验:Coding 红海与金融蓝海
每经记者注意到,Step 5 Preview 把重点检验场景锚定在 AI Coding(人工智能编程)和金融领域,这两个方向的选择本身就值得玩味。
编程是大模型商业化最成熟的场景,也是竞争最激烈的红海。IDC 数据显示,2025 年中国 AI 编程市场规模为 3.99 亿元,预计 2026 年底将飙升至 11.73 亿元。这一战场上,编程测试 SWE-bench 上长期领先的智谱 GLM 系列模型在企业级市场攻城略地,Kimi 则以超长上下文的差异化优势建立口碑,更有阿里这家在中国 AI 编程市场占有近 50% 份额的大厂一同角逐。
阶跃星辰能在这一赛道分得一杯羹吗?就测评数据来看,Step 5 Preview 在 DeepSWE v1.1 这一软件工程测试上获得 67.7% 的得分,甚至略高于 Kimi K3 与 GLM-5.3。
不过,在田丰看来,Coding agent(编程智能体)竞争的胜负手不是单次问答的基准测试分数,而是 agentic loop(智能体循环)能不能稳定跑通、工具调用会不会中途崩溃。此外,如今智谱 GLM Coding Plan、Kimi 的一系列模型已在开发者的 IDE 插件、订阅习惯、工作流中扎根,占据用户心智,即便 Step 5 Preview 的编程分数打平甚至反超,开发者迁移时会面临工具链重新集成的沉没成本,想要撬动这一心智壁垒并不容易。
金融场景,则是另一个故事。相比于打得火热的编程领域,这一领域相对是一片仍待开发的蓝海。阶跃星辰把金融选为 Step 5 Preview 的核心验证场景,不是偶然:金融连接宏观经济、政策监管、行业周期与公司经营,要求模型具备专业知识、跨行业理解、证据核验、复杂问题拆解等综合能力。值得一提的是,Step 5 Preview 在 Frontier Finance 这一金融领域基准测试中的得分也高于 GLM-5.3、Kimi K3 与 DeepSeek V4.1 Flash。

图片来源:阶跃星辰官网
就商业化落地而言,9 月 17 日,Kimi 发布金融行业解决方案,涵盖超 10 项权威数据源、9 项金融技能和 5 项合规安全措施,以及机构级的数据建模和报告交付能力,同时官宣数十家金融机构合作伙伴。智谱在金融场景也已与多家银行合作部署模型落地,今年 6 月已与中国银联签署战略合作协议。
在海外,AI 在金融领域的应用前景也受到广泛关注。9 月,OpenAI 推出金融行业的定制化服务 ChatGPT for Financial Services(金融版 ChatGPT)。而在今年 5 月已经推出 Claude for Financial Services(金融版 Claude)的 Anthropic,也于 9 月进一步推出了 Claude for Financial Advisors(面向理财 / 金融顾问的 Claude)。公开资料显示,截至今年 7 月,金融服务与保险已占 Anthropic 年度经常性收入的 25%,仅次于编程与软件工程的 36%;Anthropic 内部预计,金融领域有望在 2027 年超过编程领域,成为其最大的垂直应用市场。
阶跃星辰创始人、CEO 姜大昕近日公开表示,垂类大模型正与金融行业生产系统加速融合,背后是模型从单点应用能力向基础设施的跃迁。在这一充满前景的领域,阶跃星辰需要证明的,不仅仅是在测评分数上的领先,而是其模型、智能体产品等能否在更多金融机构中完成嵌入核心业务的现实落地。
从 Step 3.5 Flash 到 Step 5 Preview,阶跃星辰证明了一件事:在效率这条赛道上,它的执行力足够坚决,但执行力不等于胜利。随着推理成本自然下降,单纯的价格优势终将被抹平。真正的考验在场景里:Coding 的用户心智壁垒需要时间去撬动,金融领域的核心业务嵌入需要案例去证明。Step 5 Preview 把阶跃星辰重新送进了开源第一阵营,但从 " 第一阵营 " 到 " 不可替代 ",中间还需要解决很多难题。


登录后才可以发布评论哦
打开小程序可以发布评论哦