IT 之家消息,AMD 于 7 月 24 日发布博文,宣布推出 Instella-MoE 系列模型,总参数量为 16B,激活参数量为 2.8B,采用 27 层解码器架构,使用 AMD 自研的 GPU 和软件开发而成。
IT 之家援引博文介绍,AMD 本次推出的 Instella-MoE 系列模型共有 6 个版本:
性能方面,下图为 Instella-MoE-16B-A3B-Base 模型和其它模型的对比,横轴代表活跃参数量,而纵轴代表各种跑分测试,可以看到该模型跑分要低 Qwen3.5-4B-Base,不过高于其它模型。
以下是 Instella-MoE-16B-A3B-Think 与同类产品的性能对比。与 Gemma-4-E4B-it 相比,它在启用参数更少的情况下获得了更高的分数。
Instella-MoE 是 AMD 开发的最先进开源混合专家语言模型,在 AMD Instinct ™ MI300X 和 MI325X GPU 上从头开始训练。
该模型训练完全基于 AMD ROCm ™ 软件栈,以 Primus 训练和 Miles RL 框架为基础,融合了包括门控多头潜在注意力(Gated MLA)在内尖端的架构和系统创新,让 AMD 硬件上高效地进行大规模训练和推理。
在预训练阶段,FarSkip-Collective 通过专家并行带来的通信重叠,将模型预训练速度提升了 12.7%。
Instella-MoE-16B-A3B 训练流程。
Instella-MoE-16B-A3B RL 训练流程。
在推理阶段,我们使用 SGLang 推理框架实现了 Instella-MoE。通过将通信与计算重叠,当模型采用专家并行服务时,该实现可将首次 Token 响应时间 ( TTFT ) 最多缩短 39.2%。


登录后才可以发布评论哦
打开小程序可以发布评论哦