手机中国 昨天
智谱推出GLM-5.3-FlashX 推理速度最高达200 tokens/s
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

【CNMO 科技消息】9 月 18 日,智谱正式推出大模型 GLM-5.3-FlashX,该模型最高推理速度可达 200 tokens/s,将为企业和开发者提供更快、更流畅的模型体验。目前,GLM-5.3-FlashX API 已上线。据介绍,为应对快速增长的用户需求,智谱在原有国产芯片算力基础上,进一步加大了对 Infra 侧的投入与推理优化。GLM-5.3-Flash 长期保持同尺寸最强智能水平,并具备极高性价比,本次提速进一步形成智能、价格、速度的全面竞争力。

智谱

据 CNMO 科技了解,智谱此前推出了 GLM-5.3-Flash,该模型在正式发布前,曾以匿名模型 "Ox Alpha" 面向全球开发者进行了大规模测试,获得广泛认可,上线后调用量持续攀升,曾登顶 OpenRouter 平台使用量排行榜第一,同时创下 OpenCode、OpenRouter 双平台调用量新高。智谱表示,处理 GLM-5.3-Flash 全部线上调用请求共投入了 10 万颗国产芯片。虽未公开具体芯片厂商,但有行业分析师推测其大概率采用华为昇腾系列芯片。

在集群层面,智谱采用生产级 EPD 分离式架构,将多模态编码、prompt 预填充和逐 token 解码拆分为独立调度、独立扩缩容的工作池,端到端服务性能较初始基线提升 3 倍,硬件效率和单 token 成本已达到与主流英伟达 GPU 相当的水平。智谱方面表示,此次优化验证了国产芯片可在大规模场景下高效、经济地支撑前沿模型的推理需求。

版权所有,未经许可不得转载

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

英伟达 华为 芯片 gpu
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论