驱动之家 11小时前
Day-0极速适配!摩尔线程MTT S5000跑通智谱GLM-5.3-Flash:10万国产卡承载62T Token调用
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

快科技 8 月 27 日消息,8 月 26 日晚,智谱正式上线并开源 GLM-5.3-Flash(320B-A18B)原生多模态模型。摩尔线程在模型发布当天便完成 Day-0 极速适配,基于 AI 训推一体智算卡 MTT S5000 及 MUSA 软件栈实现高效运行。

GLM-5.3-Flash 总参数量 320B(3200 亿),激活参数仅 18B(180 亿),层数较 GLM-4.5 减半。模型在全球权威的 Artificial Analysis Intelligence Index 中取得 57 分;在智谱自研 Z.ai   Code Bench 体感评估中,其编程表现与 Claude Opus 4.8 相当。

正式发布前,该模型以匿名代号 Ox-Alpha(中文社区昵称 " 牛来 ")在 OpenRouter、OpenCode 两大海外平台测试,迅速登顶并刷新双平台历史纪录,Token 调用量高达 62T。

如此高的 Token 调用量,出自超过 10 万张国产芯片的集体承载,其算力供应商包括华为、海光、摩尔线程。这是国产算力芯片首次大规模集体出海支持海外最火模型。

针对 GLM-5.3-Flash 混合架构中线性注意力采用的 KDA 机制,摩尔线程基于 MATE 算子优化引擎,快速完成了状态矩阵更新、分块并行扫描等全新算子形态的定制实现与深度调优。

KDA 机制将传统注意力中随推理长度线性增长的 KV Cache 转化为固定规模状态矩阵的增量更新,显存占用不再随序列变长而膨胀。该架构特性与 MTT S5000 的高算力密度形成深度协同,为超长上下文推理提供高效支撑。

本次极速适配充分验证了 MTT S5000 智算卡的高算力密度与稳定性。MTT S5000 单卡 FP8 算力达 1000 TFLOPS,配备 80GB 显存,显存带宽 1.6TB/s,卡间互联带宽 784GB/s。

目前智谱 GLM-5.3-Flash 已开源,开发者可访问 Hugging Face 获取模型权重,摩尔线程也提供了配套的 SGLang 推理镜像供开发者开箱体验。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

摩尔 华为 ai 芯片 开源
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论