IT之家 14小时前
AMD 最强开源混合专家模型:Instella-MoE 系列 AI 登场
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

IT 之家消息,AMD 于 7 月 24 日发布博文,宣布推出 Instella-MoE 系列模型,总参数量为 16B,激活参数量为 2.8B,采用 27 层解码器架构,使用 AMD 自研的 GPU 和软件开发而成。

IT 之家援引博文介绍,AMD 本次推出的 Instella-MoE 系列模型共有 6 个版本:

性能方面,下图为 Instella-MoE-16B-A3B-Base 模型和其它模型的对比,横轴代表活跃参数量,而纵轴代表各种跑分测试,可以看到该模型跑分要低 Qwen3.5-4B-Base,不过高于其它模型。

以下是 Instella-MoE-16B-A3B-Think 与同类产品的性能对比。与 Gemma-4-E4B-it 相比,它在启用参数更少的情况下获得了更高的分数。

Instella-MoE 是 AMD 开发的最先进开源混合专家语言模型,在 AMD Instinct ™ MI300X 和 MI325X GPU 上从头开始训练。

该模型训练完全基于 AMD ROCm ™ 软件栈,以 Primus 训练和 Miles RL 框架为基础,融合了包括门控多头潜在注意力(Gated MLA)在内尖端的架构和系统创新,让 AMD 硬件上高效地进行大规模训练和推理。

在预训练阶段,FarSkip-Collective 通过专家并行带来的通信重叠,将模型预训练速度提升了 12.7%。

Instella-MoE-16B-A3B 训练流程。

Instella-MoE-16B-A3B RL 训练流程。

在推理阶段,我们使用 SGLang 推理框架实现了 Instella-MoE。通过将通信与计算重叠,当模型采用专家并行服务时,该实现可将首次 Token 响应时间 ( TTFT ) 最多缩短 39.2%。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

amd it之家 开源 gpu 软件开发
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论