谁能想到,全球旗舰模型混战打到现在,局势依旧充满变数。
昨天,阶跃星辰毫无预兆地端出了最新一代旗舰基座模型—— Step 5 Preview。
MoE 架构,600B 总参数、激活参数仅 27B,1M 上下文。
Agent 能力大幅提升,在 Artificial Analysis 的最新评测中,Step 5 Preview 取得 44 分,直接冲到全球开源 Top 2。
要知道,其他拿到这一分数的大模型,大多都是万亿参数级别。
所以相比起来,阶跃这个新模型定价蛮便宜。
百万输入:1 美元
百万输出:2.7 美元
可以说很有竞争力了,单个任务成本仅为 Opus 5 的 12.5%。
下面这张图更加直观。
AA 榜单中,Step 5 Preview 位于 Intelligence Index 与单任务成本权衡的「帕累托前沿」。
说实话,看到这个消息时我有点意外。
阶跃挺久没出现在这么靠前的位置了,之前两代模型都聚焦在 Flash 这个档位。
但 Benchmark 这东西嘛,现在大家也都懂。
榜单上你追我赶,今天刷掉一个,明天又冒出来一个。真到要用的时候,模型到底行不行,完全是另外一码事。
所以我干了一件比较费钱的事:
烧了无数 Token,并行跑了无数个 3D 资产、3D 游戏……
然后,我发现——
这模型好像还真可以啊。。。
一手实测
最近 Astra 操控软件不是很火吗?
所以 API 一接上,我直接给 Step 5 Preview 上强度,让它操作 Blender,给我建一个后室出来。
说实话,最开始我没指望它真能交付出什么东西。
结果等它自己折腾了一个多小时,我打开文件夹,再点开渲染好的 MP4,直接看愣了。
不 er,这啥啊,你搁哪个网站下载的视频??
建模本身就不说了,离谱的是,它居然自己给视频加了一堆后期。
VHS 录像质感、镜头噪点、昏黄灯光,人物走路的时候甚至还有脚步声。
给我看得有点毛骨悚然了,感觉转角会跳出一个《痴迷》女主。。。
所以咱还是做点老少皆宜的 demo 吧。
第二个任务,我让它照着 1999 年的《LEGO Racers》,直接搓一个乐高赛车游戏。
这次也挺完整。
赛道、赛车、人机车手、实时排名都有,甚至连发动机音效都给配上了。
也是给我玩得不亦乐乎。
唯一的问题是,这赛道修得也太窄了。。。
也可能主要还是因为我车技菜,经常一脚油门直接创路障上,有时候甚至连人机都跑不过。
不过吧,家人们,玩完两个 3D Demo,我是真有点顶不住了。
你要知道,我是晕 3D 的。前面两个任务搓完,差点没搁工位上吐出来。。。
最后再奉上一个《花屋》建模,接下来咱还是做点简单的 2D 任务吧。
先做了个霓虹跑酷小游戏。有意思的是,我专门用了和阶跃上一代官网 Demo 类似的 Prompt。
结果差距还是挺明显的。
道路两旁加了高楼,视觉层次更完整,Game Over 之后整个边框还会跟着变红,很多 Prompt 里没写的小细节,它自己补上了。
然后我又让它做了个写作网站。
这里必须单独表扬一句。
终于不往东坡肉里塞番茄炒蛋了。
泪目。
这审美真可以啊,而且覆盖面特别全,基本能直接拿来用了。
不过,有时候还是会出现模块溢出这种小 Bug,依然得 review,依然得改。
前面几个 Demo 也是这样。
第一轮经常有些小细节不到位,离 Astra 那种「我咧个,这是 AI 做的?」的瘫软程度,肯定还有差距。
但还是能拿来干活的。
通常指出两三轮问题,它自己修一遍,就能到可用状态。
那么问题来了。
明明前面两代还都是 Flash,怎么到 Step 5 Preview,Agent 能力突然猛了这么多?
把算力花在刀刃上
过去几年,大模型行业最简单粗暴的信仰一直是 Scaling。
更多参数,更多数据,更多算力。
确实很猛,Fable 直接给 Agent 堆超模了,涌现出不少新技能点。
但问题也很明显——
贵啊。。。
所以,Step 5 Preview 当然也在 Scaling,但它没有把「越大越好」当成唯一目标。
团队选择了一种叫Narrow but Deep的网络设计。
直译过来就是:
窄,但深。
92 层的 Transformer,在控制激活规模的同时,让信息经过更多层连续变换。
这对 Agent 尤其重要。
复杂任务里,经常会有大量 multi-hop 依赖,前面搜到的信息,要经过很多步之后才能真正派上用场。
网络更深,相当于给这些信息留下了更长的传播和推理路径。
但 Agent 还有另一个麻烦——
Context。
几十轮工具调用之后,上下文能轻松滚到上百万 Token。如果每一层都把前面所有内容重新扫一遍,计算量很快就会爆炸。
所以团队做的第二件事,就是稀疏化。
Sparse MoE、Hybrid Sparse、Sparse GQA ……本质上都是在解决上下文的问题。
当然,算法层面写个 Sparse,不代表 GPU 真的就会少干活。
索引、访存、调度这些问题处理不好,好不容易省下来的算力,全部会浪费掉。
这还稀疏个啥,稀疏不了一点。
所以 Step 5 Preview 在硬件上也下了不少功夫,通过底层算子和数据访问优化,让理论上的 Sparse 尽量真正变成实际吞吐。
有了这套软硬件基座,后面要做的事就比较清晰了,围绕 Agent 训一遍模型,让它能连续干活。
简单来说,如果以前模型的基本单位是「回答」,那现在就变成了「Loop」。
规划、执行、调用工具、看结果、发现不对、继续修。
然后再 Loop。
最终,通过 Long-horizon RL、Context Compaction 等方法,团队让 Step 5 Preview 在几十轮工具调用之后,还能记得自己到底要干嘛。
到这里,Step 5 Preview 的思路就比较完整了。
踩在「性能 × 成本」的甜蜜点上,把有限的计算预算尽量花在真正影响 Agent 能力的地方。
这也算是阶跃一直以来最擅长的事情。
从 Step 3.5 Flash,到 Step 3.7 Flash,再到今天的 Step 5 Preview,路线其实没怎么变——
尽可能让 Frontier 级能力,大家用得起。
阶跃,回来了
大模型竞赛打到今天,依旧天上一天地上一年,战场始终瞬息万变,唯一不变的共识是:
Frontier,远没有到终局。
毕竟,仅仅过去一年里,头部模型的王座就不知道换多少次了。。。
新的模型、新的技术路线不断把能力边界往前推,曾经足以建立巨大壁垒的领先优势,很多时候几个月就会被追平。
Stanford 2026 AI Index 里有个数据很有意思。
截至 2026 年 3 月,Anthropic、xAI、Google 和 OpenAI 四家公司最顶尖的模型,在 Arena 上的差距已经压缩到了 25 个 Elo 以内。
你要知道,GPT 刚发的时候,这个差距可远没有这么小。
大模型竞争正在进入全新阶段:
一方面,Frontier 的门槛越来越高;另一方面,Frontier 内部又越来越拥挤。
单纯追逐某一个 Benchmark、某一次榜单第一,已经很难定义一家模型公司的长期位置。
今天一个模型需要回答的问题,是更复杂的:
能力有没有什么差异化?
成本能不能压下来?
Benchmark 上的智能,又能不能真正迁移到复杂、开放、长程的真实任务里?
现在各家其实都已经开始疯狂点自己的技能树了。
K3 专攻前端开发,将网页设计做到极致。
V4 Flash 打爆性价比,给 Flash 级模型干成白菜价。
Astra 同样如此,Coding 其实没提升多少,但把 Computer use 的心智站住了。
大家都在寻找自己的那根长板。
这次,阶跃也给出了他们的答案。
向上,发布旗舰基座,杀回全球第一梯队。
向下,优化效率和成本,让 Agent 真正进入大众生活。
大时代啊朋友们。
说实话,这才是 AI 行业最有意思的地方,要是真靠 Scaling 解决一切,跟制造业有啥区别啊。
我一直觉得,模型层更像是一片参差不齐的竹林。
点亮任何一个技能点,都意味着 Trade-off。
更强的推理、更长的 Context、更低的延迟、更少的激活、更强的多模态、更好的 Agent 能力……
至少在相当长的一段时间里,很难有一家模型把所有方向全部点满。
所以技术路线也不会这么快收敛。
只要能找到合适的切口,总会有新模型、新公司的市场生态位。
关于 AGI 的这场马拉松,远没有跑到最后一公里。
阶跃,回来了。
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
点亮星标
科技前沿进展每日见


登录后才可以发布评论哦
打开小程序可以发布评论哦