
只改基础设施、不重新训练模型,速度提 5 倍,价格翻到 2.5 倍,还敢全面开放 API。智谱这步棋有意思。
9 月 18 日,智谱正式发布 GLM-5.3-FlashX,定位是 GLM-5.3-Flash 的极速推理版。这次它只动 Infra,不重训模型——模型的「脑子」没变,变的是让它跑多快。同样是答题,换了个更利索的跑道。
推理速度最高到 200 tokens/s,比原版快 5 倍。定价提到原版的 2.5 倍,输入 2 元、输出 7 元每百万 tokens。背后是 10 万张国产芯片组成的推理集群。智谱还披露,GLM-5.3 驱动 Agent 自优化,不到两周系统端到端吞吐比初始基线提升 3.2 倍;基座是 320B 总参、18B 激活,支持 1M 上下文。
200 tokens/s 是什么概念?正常人读东西,一秒也就十来个字,它一秒能往外吐两百个 token。对普通聊天,这快得看不出差别;可一旦跑 Agent 就完全两回事——一个任务要在后台来回调用几十次模型,速度直接决定这活能不能当天交出去。
这里有个容易被忽略的点:速度和便宜,很多时候是打架的。跑得越快,单位算力成本越高,所以它才敢把价格往上提 2.5 倍。这不是随口涨价,是明码标价地分层。说白了,智谱赌的是市面上不止一种需求——有人要极致便宜,有人要极致快,把这两拨人分开报价,比一刀切更划算。
老谭做产品这些年,最熟的一件事就是切 SKU。同一款东西,换个配置、换个价位,卖给不同的人。智谱这次干的就是这件事——把「快」单独拎出来,当一个价签卖。
客户要的从来不是最好的那款,是最合适的那款,价格带切对了,销量自己会分层。出租车和专车跑的都是那条路,差别就在你愿不愿意为更快更稳多掏钱。
我的判断是:模型正在像卖电一样,按速度、价格、智能分成不同档位往外卖。不是越强越好,而是把不同人的需求拆成不同的价格签。愿意为快付钱的,是那些跑 Agent、跑批量任务的团队,慢一秒都是成本;只求便宜的,用基础版就行。
更让我在意的是那 10 万张国产芯片。它们能满负荷跑推理,说明推理这一侧的算力卡口正在松动。卡口一松,价格战就离得更近了。真正的好戏,恐怕还在后头。
你平时用 AI,更在意它聪明,还是更在意它快?评论区说说你的选择。


登录后才可以发布评论哦
打开小程序可以发布评论哦