闪存猎手 19小时前
蚂蚁开源Ling-3.0草稿模型 单GPU推理1120 tok/s延迟不足1毫秒
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

蚂蚁集团今日宣布开源 Ling-3.0-flash-dspark,这是一个专为 Ling-3.0-flash 构建的 DSpark 草稿模型,旨在加速大模型推理效率。

官方公布的数据显示,在 4 块 NVIDIA Blackwell GPU 上、batch 为 1 的条件下,该模型在 1,000 个请求中实现了 1,120 tok/s 的吞吐量,平均 TPOT(单 token 生成时间)仅为 0.78 ms,接受长度达到 9.95。

草稿模型通常用于推测解码(Speculative Decoding)场景,通过小模型快速生成候选 token,再由大模型验证,从而在不牺牲生成质量的前提下显著提升推理速度。

此次开源意味着开发者可以在自有环境中复现这一性能表现,对于追求低延迟响应的应用场景,如实时对话、代码补全等,具有直接参考价值。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

开源 gpu 蚂蚁集团 吞吐量 nvidia
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论