8 月 26 日晚,智谱正式上线并开源 GLM-5.3-Flash ( 320B-A18B),这是 GLM-5 系列的首个原生多模态模型。其总参数 320B,能力超过 GLM-5.2,在全球权威的 Artificial Analysis Intelligence Index(AA 综合智能指数)中取得 57 分,进入全球前沿模型能力区间,与 Anthropic 最受欢迎的模型 Claude Opus 4.8 得分持平。GLM-5.3-Flash 的架构专为极低成本而设计,结合智谱最新的 30T Token 多模态预训练语料,能够以更少的计算资源实现更强的性能。
依托先进的国产异构混推技术,商汤大装置为 GLM-5.3-Flash 上线提供大规模国产算力支持与 Token 服务,打造国产算力规模化商用又一硬核落地标杆。

这一合作的背后,正是商汤打造的 " 一套模型、一座 Token(词元)工厂、一套智能体管控系统 " 核心能力体系。其中 Token 工厂承担着把智能能力规模化生产出来的关键作用:它通过多模态模型和大装置基础设施的联合优化,把不同芯片、集群、能源和交付节点组织起来,持续生产更高质量、成本更低的 Token。同时 Token 工厂与大模型之间构建起双向反哺闭环,更好适配原生多模态模型的迭代需求。商汤大装置高效支持了智谱 GLM-5.3-Flash 的上线工作,正是这套闭环能力的有力印证。
长期以来,市场对国产算力的认知是,性价比不高、难以规模商用。而在正式发布前,GLM-5.3-Flash 以匿名模型 Ox-Alpha(中文社区称作牛来)在 OpenCode 和 OpenRouter 上进行了大规模测试,Token 调用量高达 62T,这些请求流量全部由国产芯片提供算力支持。且相较同一硬件环境下的初始基线,GLM-5.3-Flash 基于国产芯片集群,端到端服务性能提升 3 倍,硬件效率和单 Token 成本已达到主流英伟达 GPU 相当水平。
这一实践表明,国产算力已经能够在大规模真实业务场景下,高效、经济地支撑前沿大模型推理需求。
作为最懂大模型的 AI 基础设施,商汤大装置全面拥抱国产化,并持续推动国产算力从 " 单点可用 " 走向 " 大规模商用 "。今年 WAIC 期间,针对当前国产算力规模化商用卡点,商汤大装置从 " 性价比、适配性、能效比 " 三个维度系统性破题。
在性价比层面,商汤大装置跳出单卡性能比拼的传统思路,通过先进的异构混合推理技术,根据不同推理阶段对计算、带宽的不同需求让不同架构、不同定位的国产芯片各尽其长、高效协同,整体推理性价比达到 NVIDIA H 系列的 1.25 倍,相比国产同构推理,同等成本下 Token 产能扩大约 2.5 倍。
在适配性上,通过底层算子优化、多卡并行调优和工具链适配等,大幅降低国产算力应用门槛。在能效比层面,商汤大装置推出算电协同 Agent,并重新定义 TPW(Tokens Per Watt)作为 AIDC 全新价值标尺。
此外,通过整合多元算力,并持续优化推理引擎与芯片性能,商汤大装置 Token Factory 正在形成大规模、高效率、低成本的 Token 供给能力,7 月日均 Token 服务量已达到 2.42 万亿,预计 2026 年年底突破日均 10 万亿,全年 Token 量级增长 25 倍。
未来,商汤大装置将持续投入基于国产化算力的 Token 服务建设,打造高性能、低成本、可规模交付的 AI 基础设施,推动国产算力从单点技术突破走向产业体系化繁荣。


登录后才可以发布评论哦
打开小程序可以发布评论哦