AMD釋出全開源MoE大模型Instella-MoE,16B引數規模挑戰主流開源模型
律律动
7月25日,AMD宣佈推出全開源混合專家模型(MoE)Instella-MoE。該模型擁有160億總引數(16B),每個Token啟用28億引數,AMD稱在同規模開源語言模型中具備領先效能。
Instella-MoE基於AMD Instinct MI300X和MI325X GPU及ROCm軟體棧訓練,採用Gated Multi-head Latent Attention和FarSkip-Collective等架構創新。效能測試顯示Instella-MoE-16B-A3B平均得分76.7,領先於SmolLM3-3B、OLMo-3-7B等模型;支援64K Token長上下文並完成預訓練、中期訓練、長上下文擴充套件、SFT、DPO及RL等完整訓練流程。AMD已同步公開全部模型權重、訓練配置、資料配比、中間檢查點及推理程式碼,表示將繼續推進更大規模、更高效的開源語言模型研發。
[律動]