蚂蚁集团今日宣布开源 Ling-3.0-flash-dspark,这是一个专为 Ling-3.0-flash 构建的 DSpark 草稿模型,旨在加速大模型推理效率。
官方公布的数据显示,在 4 块 NVIDIA Blackwell GPU 上、batch 为 1 的条件下,该模型在 1,000 个请求中实现了 1,120 tok/s 的吞吐量,平均 TPOT(单 token 生成时间)仅为 0.78 ms,接受长度达到 9.95。

草稿模型通常用于推测解码(Speculative Decoding)场景,通过小模型快速生成候选 token,再由大模型验证,从而在不牺牲生成质量的前提下显著提升推理速度。
此次开源意味着开发者可以在自有环境中复现这一性能表现,对于追求低延迟响应的应用场景,如实时对话、代码补全等,具有直接参考价值。


登录后才可以发布评论哦
打开小程序可以发布评论哦