Instella-MoE:AMD开源的端到端混合专家大语言模型
一、Instella-MoE是什么
Instella-MoE 是AMD AGI团队开源的自研MoE(混合专家)大语言模型项目,核心成品模型为 Instella-MoE-16B-A3B-Think,模型总参数量16B,推理时仅激活2.8B稀疏参数,原生支持64k上下文窗口。
整套项目并非只开放模型权重,而是完整释放从数据预处理、预训练、微调、强化学习、模型蒸馏到高性能推理的全链路工程代码。模型全程基于AMD Instinct MI300X/MI325X加速卡训练,依托ROCm软件栈,完全脱离NVIDIA CUDA生态,是AMD面向大模型稀疏训练场景推出的软硬件协同开源方案。
协议区分:训练与推理源代码采用MIT协议;模型权重遵循ResearchRAIL协议,仅限学术研究用途。

二、功能特色
稀疏MoE高效架构
总参16B、激活参数仅2.8B,以小激活参数实现大模型容量效果,降低推理显存与算力开销。原生64k超长上下文支持
经过两阶段长文本专项训练,可稳定处理长文档、代码文件、超长对话场景。端到端完整训练流水线
开放预训练、中期训练、长上下文拓展、SFT监督微调、DPO偏好优化、IF-RL指令强化、MOPD多教师蒸馏全部阶段脚本。两大自研核心技术优化
Gated MLA门控多头隐注意力、FarSkip-Collective MoE通信优化,解决长序列算力损耗与MoE分布式专家通信瓶颈。ROCm原生适配
专为AMD Instinct系列GPU优化,配套专用训练、推理容器镜像,兼容SGLang推理框架。多阶段中间权重可用
开放训练流程各阶段Checkpoint,研究者可基于任意阶段权重开展二次实验。
三、技术细节
3.1 模型基础架构
架构类型:MoE混合专家大语言模型
总参数:16B,激活参数:2.8B
上下文长度:64k tokens
分词器:DeepSeekV3 Tokenizer
基座训练算力载体:AMD MI300X / MI325X
软件栈:ROCm、Primus训练框架、Miles强化学习框架
3.2 核心自研技术
Gated MLA(门控多头隐注意力)
在MLA隐注意力基础上增加门控机制,降低64k长上下文场景下注意力计算成本,提升长文本检索与理解能力。FarSkip-Collective
MoE模型最大痛点为专家之间数据通信延迟;该通信方案优化专家路由数据传输,减少分布式集群通信阻塞,大幅提升MoE多卡训练、多卡推理吞吐。
3.3 完整七阶段训练链路
预训练:7.1万亿token基础数据从零训练
中期训练:多分支权重训练+权重融合
长上下文训练:两阶段拓展至64k窗口
SFT监督微调:两轮指令数据微调
DPO直接偏好优化:对齐人类偏好
IF-RL指令强化学习:增强指令跟随能力
MOPD多教师在线蒸馏:融合DPO与IF-RL双模型优势,产出最终Think版本
3.4 推理技术
原生基于SGLang v0.5.9开发适配层,内置FarSkip-Collective接口;提供容器镜像一键部署,支持批量评测、流式对话推理。

四、应用场景
学术科研场景
MoE稀疏大模型算法研究、长上下文大模型训练方案复现、分布式MoE通信优化实验、大模型对齐技术研究。长文本处理场景
超长文档摘要、法律文书解析、完整代码库读取、长篇资料问答。代码与数理推理场景
代码编写、逻辑推理、数学计算、复杂问题分步思考。硬件适配研究
AMD ROCm生态下大模型迁移、MI系列GPU稀疏模型性能调优、脱离CUDA的大模型工程实践。
限制:权重协议约束,不可直接用于商用产品落地,仅允许学术研究。
五、使用方法
5.1 环境准备
项目推荐使用官方预构建容器镜像
训练镜像:
rocm/megatron-lm推理&强化学习镜像:
rlsys/miles:rocm7-mi300-sglangxxx
运行环境要求:AMD Instinct MI300X/MI325X,ROCm 7.0及以上版本。
5.2 训练流程
仓库training/目录提供全套脚本:支持原始JSONL语料分词预处理、预训练、长上下文拓展、SFT、DPO训练;同时提供Checkpoint权重合并工具。
强化学习相关脚本存放于rl/目录,用于IF-RL、MOPD蒸馏实验。
5.3 推理部署
进入inference/文件夹,依托SGLang加载模型权重,内置对话模板,支持两种方式:
Hugging Face Transformers原生加载测试
SGLang高性能批量推理与自动化基准评测
5.4 快速验证
仓库附带Mock测试脚本,无需完整权重,可先行验证代码链路是否正常运行。
六、竞品对比
选取同类型开源MoE大模型进行横向对比
| 项目 | Instella-MoE-16B-A3B-Think | DeepSeek-V3 | Qwen-MoE |
|---|---|---|---|
| 开发厂商 | AMD AGI团队 | 深度求索 | 阿里通义千问 |
| 硬件生态 | 原生ROCm,适配AMD MI系列GPU,无CUDA依赖 | 优先NVIDIA CUDA,ROCm兼容性有限 | 优先CUDA,支持部分AMD环境 |
| 激活参数 | 2.8B(总参16B) | 3.7B(总参67B) | 4B(总参56B) |
| 上下文窗口 | 64k | 128k | 128k |
| 开源范围 | 训练+微调+RL+推理全链路代码开放 | 仅开放推理权重,完整训练代码未开源 | 开放基座权重,训练链路不完全开放 |
| 核心优化 | FarSkip通信优化、Gated MLA | 多头潜在注意力MLA | 改进型MoE路由均衡策略 |
| 权重协议 | ResearchRAIL(仅限科研) | 非商用协议 | Apache 2.0(可商用) |

七、常见问题解答
Q:Instella-MoE模型权重可以直接用于商业产品开发吗?
A:不可以。模型权重采用ResearchRAIL协议,仅支持学术研究使用;项目源代码为MIT协议,代码可自由修改使用,但使用权重需要遵守权重独立许可。
Q:没有AMD MI300X显卡,可以运行Instella-MoE吗?
A:普通消费级AMD显卡可尝试推理测试,但训练流程针对MI300X/MI325X加速卡深度优化,消费卡不推荐开展完整训练任务,存在性能异常、显存不足问题。NVIDIA显卡缺少原生ROCm支持,运行会存在大量适配工作量,官方不提供相关兼容方案。
Q:FarSkip-Collective可以移植到其他MoE模型上使用吗?
A:代码模块独立实现,理论上可以迁移至其他MoE架构;但是该方案针对AMD集群通信特性优化,迁移后需要重新调试分布式通信逻辑。
Q:Instella-MoE和普通稠密LLM相比优势在哪里?
A:相同算力条件下,MoE架构依靠稀疏激活,能够使用更大总参数量模型;Instella-MoE仅激活2.8B参数就能逼近更大稠密模型能力,适合追求推理成本控制、长文本处理的研究场景。
Q:是否提供中文专项优化版本?
A:官方基础模型无单独中文微调版本,基础预训练语料包含多语言文本,有需求可基于开放SFT脚本自行开展中文指令微调。
八、相关链接
GitHub仓库地址:https://github.com/AMD-AGI/Instella-MoE
Hugging Face模型库:https://huggingface.co/collections/amd/instella-moe
九、总结
Instella-MoE是AMD推出的一套软硬协同、全链路开源混合专家大模型解决方案,不仅开放16B总参、2.8B激活参数、支持64k上下文的MoE模型权重,同时完整公开从数据处理、多阶段训练、强化学习蒸馏到高性能推理的全套工程代码,搭配自研Gated MLA与FarSkip-Collective技术优化长上下文计算与MoE分布式通信瓶颈,依托ROCm生态摆脱对CUDA的依赖,为研究人员提供了一套可完整复现、适配AMD高端加速卡的稀疏大模型实验底座,是面向MoE大模型科研领域重要的开源项目。
版权及免责申明:本文由@AI工具集原创发布。该文章观点仅代表作者本人,不代表本站立场。本站不承担任何相关法律责任。
如若转载,请注明出处:https://www.aipuzi.cn/ai-news/instella-moe.html

