Instella-MoE:AMD开源的端到端混合专家大语言模型

AI新闻 AI工具集
62

一、Instella-MoE是什么

Instella-MoE 是AMD AGI团队开源的自研MoE(混合专家)大语言模型项目,核心成品模型为 Instella-MoE-16B-A3B-Think,模型总参数量16B,推理时仅激活2.8B稀疏参数,原生支持64k上下文窗口。

整套项目并非只开放模型权重,而是完整释放从数据预处理、预训练、微调、强化学习、模型蒸馏到高性能推理的全链路工程代码。模型全程基于AMD Instinct MI300X/MI325X加速卡训练,依托ROCm软件栈,完全脱离NVIDIA CUDA生态,是AMD面向大模型稀疏训练场景推出的软硬件协同开源方案。

协议区分:训练与推理源代码采用MIT协议;模型权重遵循ResearchRAIL协议,仅限学术研究用途

Instella-MoE(图1)

二、功能特色

  1. 稀疏MoE高效架构
    总参16B、激活参数仅2.8B,以小激活参数实现大模型容量效果,降低推理显存与算力开销。

  2. 原生64k超长上下文支持
    经过两阶段长文本专项训练,可稳定处理长文档、代码文件、超长对话场景。

  3. 端到端完整训练流水线
    开放预训练、中期训练、长上下文拓展、SFT监督微调、DPO偏好优化、IF-RL指令强化、MOPD多教师蒸馏全部阶段脚本。

  4. 两大自研核心技术优化
    Gated MLA门控多头隐注意力、FarSkip-Collective MoE通信优化,解决长序列算力损耗与MoE分布式专家通信瓶颈。

  5. ROCm原生适配
    专为AMD Instinct系列GPU优化,配套专用训练、推理容器镜像,兼容SGLang推理框架。

  6. 多阶段中间权重可用
    开放训练流程各阶段Checkpoint,研究者可基于任意阶段权重开展二次实验。

三、技术细节

3.1 模型基础架构

  • 架构类型:MoE混合专家大语言模型

  • 总参数:16B,激活参数:2.8B

  • 上下文长度:64k tokens

  • 分词器:DeepSeekV3 Tokenizer

  • 基座训练算力载体:AMD MI300X / MI325X

  • 软件栈:ROCm、Primus训练框架、Miles强化学习框架

3.2 核心自研技术

  1. Gated MLA(门控多头隐注意力)
    在MLA隐注意力基础上增加门控机制,降低64k长上下文场景下注意力计算成本,提升长文本检索与理解能力。

  2. FarSkip-Collective
    MoE模型最大痛点为专家之间数据通信延迟;该通信方案优化专家路由数据传输,减少分布式集群通信阻塞,大幅提升MoE多卡训练、多卡推理吞吐。

3.3 完整七阶段训练链路

  1. 预训练:7.1万亿token基础数据从零训练

  2. 中期训练:多分支权重训练+权重融合

  3. 长上下文训练:两阶段拓展至64k窗口

  4. SFT监督微调:两轮指令数据微调

  5. DPO直接偏好优化:对齐人类偏好

  6. IF-RL指令强化学习:增强指令跟随能力

  7. MOPD多教师在线蒸馏:融合DPO与IF-RL双模型优势,产出最终Think版本

3.4 推理技术

原生基于SGLang v0.5.9开发适配层,内置FarSkip-Collective接口;提供容器镜像一键部署,支持批量评测、流式对话推理。

fig_cost_performance

四、应用场景

  1. 学术科研场景
    MoE稀疏大模型算法研究、长上下文大模型训练方案复现、分布式MoE通信优化实验、大模型对齐技术研究。

  2. 长文本处理场景
    超长文档摘要、法律文书解析、完整代码库读取、长篇资料问答。

  3. 代码与数理推理场景
    代码编写、逻辑推理、数学计算、复杂问题分步思考。

  4. 硬件适配研究
    AMD ROCm生态下大模型迁移、MI系列GPU稀疏模型性能调优、脱离CUDA的大模型工程实践。

限制:权重协议约束,不可直接用于商用产品落地,仅允许学术研究。

五、使用方法

5.1 环境准备

项目推荐使用官方预构建容器镜像

  • 训练镜像:rocm/megatron-lm

  • 推理&强化学习镜像:rlsys/miles:rocm7-mi300-sglangxxx
    运行环境要求:AMD Instinct MI300X/MI325X,ROCm 7.0及以上版本。

5.2 训练流程

仓库training/目录提供全套脚本:支持原始JSONL语料分词预处理、预训练、长上下文拓展、SFT、DPO训练;同时提供Checkpoint权重合并工具。
强化学习相关脚本存放于rl/目录,用于IF-RL、MOPD蒸馏实验。

5.3 推理部署

进入inference/文件夹,依托SGLang加载模型权重,内置对话模板,支持两种方式:

  1. Hugging Face Transformers原生加载测试

  2. SGLang高性能批量推理与自动化基准评测

5.4 快速验证

仓库附带Mock测试脚本,无需完整权重,可先行验证代码链路是否正常运行。

六、竞品对比

选取同类型开源MoE大模型进行横向对比

项目 Instella-MoE-16B-A3B-Think DeepSeek-V3 Qwen-MoE
开发厂商 AMD AGI团队 深度求索 阿里通义千问
硬件生态 原生ROCm,适配AMD MI系列GPU,无CUDA依赖 优先NVIDIA CUDA,ROCm兼容性有限 优先CUDA,支持部分AMD环境
激活参数 2.8B(总参16B) 3.7B(总参67B) 4B(总参56B)
上下文窗口 64k 128k 128k
开源范围 训练+微调+RL+推理全链路代码开放 仅开放推理权重,完整训练代码未开源 开放基座权重,训练链路不完全开放
核心优化 FarSkip通信优化、Gated MLA 多头潜在注意力MLA 改进型MoE路由均衡策略
权重协议 ResearchRAIL(仅限科研) 非商用协议 Apache 2.0(可商用)

training_pipeline

七、常见问题解答

Q:Instella-MoE模型权重可以直接用于商业产品开发吗?

A:不可以。模型权重采用ResearchRAIL协议,仅支持学术研究使用;项目源代码为MIT协议,代码可自由修改使用,但使用权重需要遵守权重独立许可。

Q:没有AMD MI300X显卡,可以运行Instella-MoE吗?

A:普通消费级AMD显卡可尝试推理测试,但训练流程针对MI300X/MI325X加速卡深度优化,消费卡不推荐开展完整训练任务,存在性能异常、显存不足问题。NVIDIA显卡缺少原生ROCm支持,运行会存在大量适配工作量,官方不提供相关兼容方案。

Q:FarSkip-Collective可以移植到其他MoE模型上使用吗?

A:代码模块独立实现,理论上可以迁移至其他MoE架构;但是该方案针对AMD集群通信特性优化,迁移后需要重新调试分布式通信逻辑。

Q:Instella-MoE和普通稠密LLM相比优势在哪里?

A:相同算力条件下,MoE架构依靠稀疏激活,能够使用更大总参数量模型;Instella-MoE仅激活2.8B参数就能逼近更大稠密模型能力,适合追求推理成本控制、长文本处理的研究场景。

Q:是否提供中文专项优化版本?

A:官方基础模型无单独中文微调版本,基础预训练语料包含多语言文本,有需求可基于开放SFT脚本自行开展中文指令微调。

八、相关链接

九、总结

Instella-MoE是AMD推出的一套软硬协同、全链路开源混合专家大模型解决方案,不仅开放16B总参、2.8B激活参数、支持64k上下文的MoE模型权重,同时完整公开从数据处理、多阶段训练、强化学习蒸馏到高性能推理的全套工程代码,搭配自研Gated MLA与FarSkip-Collective技术优化长上下文计算与MoE分布式通信瓶颈,依托ROCm生态摆脱对CUDA的依赖,为研究人员提供了一套可完整复现、适配AMD高端加速卡的稀疏大模型实验底座,是面向MoE大模型科研领域重要的开源项目。

打赏
THE END
作者头像
AI工具集
工具不孤岛,AI集大成——这里有你要的一切智能解法