AMD发布全开源MoE大模型Instella-MoE,16B参数规模挑战主流开源模型

律动BlockBeats
律动BlockBeats|2026年07月25日 03:19
7 月 25 日,AMD 宣布推出全开源混合专家模型(MoE)Instella-MoE,该模型拥有 160 亿总参数,每个 Token 激活 28 亿参数,号称在同规模开源语言模型中具备领先性能。AMD 表示,Instella-MoE 完全基于自家 AMD Instinct MI300X 和 MI325X GPU,以及 ROCm 软件栈从零训练完成,并采用 Gated Multi-head Latent Attention(Gated MLA)和 FarSkip-Collective 等架构创新,以提升训练和推理效率。性能测试显示,Instella-MoE-16B-A3B 基础模型平均得分达到 76.7 分,在全开源模型中排名领先,超过 SmolLM3-3B、OLMo-3-7B 等模型,并在仅激活 28 亿参数的情况下,与更大规模模型竞争。此外,该模型支持 64K Token 长上下文处理,并完成预训练、中期训练、长上下文扩展、监督微调(SFT)、直接偏好优化(DPO)以及强化学习(RL)等完整训练流程。AMD 此次同步公开 Instella-MoE 全部模型权重、训练配置、数据配比、中间检查点及推理代码,推动开放 AI 模型研究与复现。AMD 表示,Instella-MoE 展示了基于 AMD 硬件和开放软件生态进行大规模 MoE 模型训练的能力,未来将继续推进更大规模、更强推理能力和更高效率的开源语言模型研发。[原文链接](BlockBeats)
+4
曾提及
分享至:

脉络

热门快讯

APP下载

X

Telegram

Facebook

Reddit

复制链接

热门阅读