驱动之家 14小时前
国产GPU首入CNCF国际开源生态!沐曦携手密瓜智能完成llm-d适配:单卡吞吐5773 tokens/s
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

快科技 9 月 8 日消息,近日,云原生分布式推理开源项目 llm-d 正式纳入沐曦曦云 C 系列 GPU 支持,这是 llm-d 官方支持的加速器名单中首次出现国产 GPU。

llm-d 由 Red Hat 发起,构建于 vLLM、SGLang 等推理引擎与 Kubernetes 之上,目前已交由 CNCF(云原生计算基金会)托管。

该项目聚焦前缀缓存感知路由、负载感知调度与 Prefill/Decode 分离等关键能力,GitHub 已获超 4400 Star。英伟达 GPU、谷歌 TPU、AMD GPU、英特尔 XPU 等主流算力平台均已在该社区形成部署指南。

沐曦股份此次与密瓜智能(Dynamia AI)合作,率先完成曦云 C 系列 GPU 在 llm-d 社区的完整适配,实现了基于曦云 C 系列 GPU 硬件环境下的单卡、多卡及 Prefill/Decode 分离推理部署验证。

大模型从可运行到可规模化服务,算力芯片本身只是起点。芯片能否顺畅接入云原生推理调度体系,才是决定落地效率的关键。

此前,此类国际开源项目的默认配置多以国外芯片为假设前提,国产 GPU 即便已能运行主流推理引擎,用户仍需自行摸索大量隐性适配细节。

本次适配打通了从芯片到生产级推理系统的最后一公里,为曦云 C 系列 GPU 提供了三条开箱即用的部署路径:

优化基线单卡路径:以 Qwen3-14B、张量并行 TP=1 为配置,验证曦云 C 系列在 llm-d 标准模型服务栈下的基础推理能力。

优化基线八卡路径:以 DeepSeek-R1-Distill-Llama-70B、张量并行 TP=8 为配置,验证单机八卡下的大参数量模型服务能力。

Prefill/Decode 分离路径:以 Prefill+1 Decode 拓扑运行 Qwen3-14B,基于 vLLM NixlConnector 与 llm-d 路由 Sidecar 打通 KV 缓存跨实例传输链路。

性能标定方面,团队在曦云 C 系列 GPU 上完成了 llm-d 推理路由器的实测:Qwen3-14B 单卡配置下测得峰值 Prefill 吞吐 5773 tokens/s,DeepSeek-R1-Distill-Llama-70B 八卡配置下测得 5468 tokens/s。

两组数据已并入 llm-d 社区公开标定矩阵,国内用户在沐曦平台部署时可直接引用来自真实硬件的性能基线。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

gpu 开源 芯片 云原生 标定
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论