AMD 最强开源混合专家模型:Instella-MoE 系列 AI 登场,16B 参数、自有 GPU 训练
最新 7 月 28 日消息,AMD 于 7 月 24 日发布博文,宣布推出 Instella-MoE 系列模型,总参数量为 16B,激活参数量为 2.8B,采用 27 层解码器架构,使用 AMD 自研的 GPU 和软件开发而成。
最新援引博文介绍,AMD 本次推出的 Instella-MoE 系列模型共有 6 个版本:
模型 | 阶段 | 描述 |
|---|---|---|
Instella-MoE-16B-A3B-Pretrain | 预训练 | 基于大型多样化训练语料库从头开始训练的 MoE 基础模型。 |
Instella-MoE-16B-A3B-Midtrain | Mid-training | 在高质量混合数据上进一步训练的预训练模型,完善关键能力。 |
Instella-MoE-16B-A3B-Base | Long-context | 长上下文训练旨在提升模型处理和推理更长序列的能力。我们将其作为最终的基础检查点。 |
Instella-MoE-16B-A3B-SFT | SFT | 通过监督微调 (SFT) 扩展基础检查点,实现指令跟踪和链式推理能力。 |
Instella-MoE-16B-A3B-DPO | DPO | 基于对比偏好数据的直接偏好优化(DPO)以提高模型性能。 |
Instella-MoE-16B-A3B-Think | RL | 通过强化学习(RL)对最终思维检查点进行改进,以进一步加强对指令的遵循和整体反应质量。 |
性能方面,下图为 Instella-MoE-16B-A3B-Base 模型和其它模型的对比,横轴代表活跃参数量,而纵轴代表各种跑分测试,可以看到该模型跑分要低 Qwen3.5-4B-Base,不过高于其它模型。

以下是 Instella-MoE-16B-A3B-Think 与同类产品的性能对比。与 Gemma-4-E4B-it 相比,它在启用参数更少的情况下获得了更高的分数。

Instella-MoE 是 AMD 开发的最先进开源混合专家语言模型,在 AMD Instinct™ MI300X 和 MI325X GPU 上从头开始训练。
该模型训练完全基于 AMD ROCm™ 软件栈,以 Primus 训练和 Miles RL 框架为基础,融合了包括门控多头潜在注意力(Gated MLA)在内尖端的架构和系统创新,让 AMD 硬件上高效地进行大规模训练和推理。
在预训练阶段,FarSkip-Collective 通过专家并行带来的通信重叠,将模型预训练速度提升了 12.7%。


在推理阶段,我们使用 SGLang 推理框架实现了 Instella-MoE。通过将通信与计算重叠,当模型采用专家并行服务时,该实现可将首次 Token 响应时间 (TTFT) 最多缩短 39.2%。


《AMD 最强开源混合专家模型:Instella-MoE 系列 AI 登场,16B 参数、自有 GPU 训练》转载自互联网,如有侵权,联系我们删除,QQ:369-8522。
相关图文
-
ESP32-AI 亮相:8MB PSRAM 运行 2890 万参数模型,设想离线调配出最佳咖啡
科技媒体 Tom's Hardware 昨日(7 月 27 日)发布博文,报道称乌克兰开发者 Slava S 发布 ESP32-AI 项目,针对乐鑫(Espressif)的 ESP32-S3 开发板,成功部署 2890 万个参数的本地 AI 模型。... -
国内首个能“飞檐走壁”的具身智能特种机器人亮相,还有“六臂玄甲”
该机器人支持攀爬作业,它可以垂直墙面飞檐走壁,左手打磨、右手焊接,高效协同,集人形双臂、磁吸爬壁、大模型智能于一体,专攻化工储罐、船舶、能源设施等大型钢结构外壁。#飞檐走壁机器人# #国内首个具身智能特种机器人#... -
首届 CMG 世界机器人登泰山大赛启动
大赛将以泰山红门至中天门的登山步道为赛道,让泰山的复杂环境成为具身智能的实景实训“天然极限试验场”,考验机器人感知决策、操作执行、环境适应和可靠运行能力。... -
比亚迪人形机器人确认 8 月在郑州“上岗”
据财联社今天(28 日)下午报道,比亚迪方面证实,人形机器人产品将于 8 月正式亮相。公开信息显示,“迪空间”也是比亚迪新技术、新产品的首发场景,郑州是首座迪空间的所在地。... -
争夺印度开发者市场:Cursor 推出月付 649 卢比 Start 套餐
Cursor 表示印度已是其全球第三大市场,过去一年内 Cursor 印度客户增长到了原来的三倍,印度的高级用户数量也高于世界上任何其他市场。...












