AngelSpec:腾讯开源统一投机解码草稿模型训练框架
一、AngelSpec是什么
AngelSpec 是腾讯混元AI基础设施团队开源、基于PyTorch构建的工业级投机解码(Speculative Decoding)草稿模型全流程训练框架,框架打通训练、在线评估、分布式部署链路,原生适配Qwen、腾讯混元(Hunyuan/Hy3)等主流大模型基座,面向科研人员与大模型线上推理工程团队,解决传统草稿模型训练框架架构碎片化、训练推理割裂、长上下文支持弱、线上真实效果难以验证等痛点。
二、功能特色
多架构统一训练入口
单一框架支持6大类主流草稿模型架构,仅修改配置文件即可切换方案,包含DFly、DFlash、DFlare、Eagle3、MTP、DSpark,覆盖块并行、自回归TTT、混合三大技术路线。长上下文原生支持
集成Ulysses序列并行技术,最高支持128k上下文长度训练,内置40k上下文开箱即用训练配置,适配超长文本、文档问答场景下的投机解码优化。多样化损失函数组合
内置CE损失、KL散度、LK损失、D-PACE权重、TV损失等多种目标函数,自由组合调优,提升草稿Token被主模型接受率,直接影响推理加速效果。文档感知样本打包机制
采用Megatron风格定长序列打包,强制隔离不同文档样本,规避跨文档污染问题,MTP、DFlash两条核心训练链路通用。训练阶段在线仿真评估
训练过程可直接对接vLLM/SGLang推理引擎,实时运行真实投机解码流程,输出平均接受长度、逐位置Token接受率等线上核心指标,不再只依赖离线损失判断模型优劣。训练/推理集群解耦分布式架构
依托Mooncake张量存储实现训练集群、推理集群分离部署,两类算力可以独立扩容,满足线上高并发业务持续微调草稿模型的需求。完善工程化配套
提供单节点、多节点分布式训练脚本、环境一键构建脚本、单元测试、完整文档,兼容主流CUDA 12.x环境,支持续训、从零初始化两种训练模式。

三、技术细节
3.1 支持的六大草稿模型架构
| 架构分类 | 模型名称 | 核心技术特点 | 适用场景 |
|---|---|---|---|
| 块并行架构 | DFly | 混合条件目标+隐藏状态校正AR头,腾讯主推工业方案 | 线上高并发生产推理 |
| 块并行架构 | DFlash | 锚点采样+并行分块生成 | 通用场景,平衡速度与效果 |
| 块并行架构 | DFlare | DFlash基础上增加分层可学习目标融合 | 追求更高草稿接受率场景 |
| 自回归TTT架构 | MTP | 多头多Token预测,适配MoE基座,支持on-policy滚动训练 | MoE大模型基座适配 |
| 自回归TTT架构 | Eagle3 | 测试时训练架构,输入特征融合 | 轻量化、小参数量基座 |
| 混合架构 | DSpark | DFlash主干+EAGLE自回归预测头 | 兼顾并行生成与自回归特性 |
3.2 底层核心组件
TorchSpec:框架基础底层,在此之上二次开发实现AngelSpec完整训练逻辑;
Mooncake:张量分布式存储组件,负责训练侧隐状态向推理侧高效传输,实现训推分离;
推理后端对接层:原生兼容vLLM、SGLang两大主流开源推理引擎,训练中实时仿真投机解码;
序列并行模块:Ulysses并行实现超长上下文训练显存优化;
多目标损失调度器:支持动态调整各类损失权重,自动化消融实验。
3.3 核心工作流程
加载基座大模型 → 选定草稿模型架构并初始化 → 文档隔离样本预处理打包 → 多损失联合训练 → 周期性推送权重至推理集群 → 实时运行投机解码评测并记录指标 → 根据指标迭代超参持续训练。
四、应用场景
大模型线上推理加速
云厂商、AI服务商部署LLM服务,训练专属Drafter草稿模型,利用投机解码降低Token生成延迟,提升服务吞吐量。MoE混合专家模型优化
针对混元Hy3、Qwen MoE等大模型,训练MTP架构草稿模型,缓解MoE推理算力开销大的问题。超长文本业务场景
知识库问答、长文档总结、小说续写等16k~128k上下文业务,训练适配长文本的草稿模型。学术科研实验
研究者快速对比Eagle、MTP、DFlash等多种投机解码方案,统一训练底座,减少重复工程开发。私有化大模型部署
企业本地部署私有大模型,自定义训练适配行业数据的草稿模型,不依赖第三方预训练Drafter。
五、使用方法
5.1 环境准备
框架推荐CUDA 12.x,支持A100、H20等主流GPU。
克隆项目仓库
git clone https://github.com/Tencent/AngelSpec cd AngelSpec
构建运行环境
可执行项目内置脚本一键构建conda环境
bash build_conda.sh
也可使用本地pip模式安装框架依赖。
额外依赖:Mooncake张量传输组件、vLLM或SGLang推理后端。
5.2 启动训练
项目configs目录提供大量预设配置文件,examples内置开箱即用脚本。
单节点训练示例:Qwen3-8B DFly草稿模型训练
多节点训练示例:混元Hy3大模型分布式训练
支持命令行参数覆盖配置文件内学习率、训练步数、上下文长度等超参。
两种训练模式可选:
从零初始化草稿模型训练;
加载已有权重持续微调(CPT)。
5.3 效果评估
训练脚本内置评测逻辑,周期性启动投机解码仿真,自动输出关键指标,无需单独离线写评测代码。

六、竞品对比
选取当前投机解码训练领域主流开源框架做横向对比
| 项目名称 | AngelSpec(腾讯) | Eagle Training Code | vLLM Spec Train |
|---|---|---|---|
| 开发主体 | 腾讯混元AI Infra团队 | 耶鲁大学开源社区 | vLLM官方团队 |
| 支持Drafter架构 | DFly/DFlash/MTP/Eagle3等6种架构 | 仅Eagle系列架构 | 原生MTP,架构扩展性有限 |
| 训推分离分布式 | 支持(Mooncake) | 不支持,训推同集群 | 不支持 |
| 超长上下文训练 | 最高128k(Ulysses并行) | 有限支持 | 依赖外部并行方案 |
| 训练实时投机评测 | 原生内置 | 需要自行开发对接 | 仅离线损失评估 |
| 适配基座 | Qwen、Hy3等稠密/MoE模型 | 稠密通用基座 | 主流稠密模型,MoE适配较弱 |
| 工程配套 | 完整脚本、配置、单元测试 | 最简实验代码,工程化薄弱 | 偏向推理,训练工具链不完善 |
七、常见问题解答
Q:AngelSpec只能使用腾讯混元大模型吗?
A:不是。框架原生支持Qwen系列模型,同时兼容主流稠密大模型、MoE混合专家模型,任何开源基座只要格式适配,均可用来训练草稿模型。
Q:运行AngelSpec必须搭配vLLM吗?
A:不是。框架同时支持vLLM、SGLang两种推理后端,可以根据自身部署环境自由选择,仅需要安装对应后端依赖包。
Q:Mooncake组件是强制依赖吗?单机训练场景是否可以移除?
A:Mooncake主要用于多集群训推分离场景。单节点小规模训练场景,不需要部署Mooncake,可关闭分布式跨集群通信功能正常运行训练。
Q:AngelSpec训练出来的草稿模型,可以直接在其他推理框架使用吗?
A:模型权重为标准PyTorch格式,导出后可适配支持对应投机解码方案的推理引擎;需要注意架构匹配,DFly、DFlash等自研架构需要推理侧实现对应解码逻辑。
Q:普通消费级显卡能否运行AngelSpec?
A:小规模测试、小基座模型(如8B)可以在高端消费显卡开展实验;正式训练草稿模型、128k长上下文训练,建议使用数据中心专业GPU。
Q:框架是否提供预训练好的草稿模型权重?
A:配套项目AngelSlim发布了多套预训练Drafter权重,包含Hy3、Qwen3-8B适配版本,可直接下载用于推理或二次微调。
八、相关链接
GitHub开源仓库:https://github.com/Tencent/AngelSpec
arXiv论文地址:https://arxiv.org/abs/2607.25852
Hugging Face模型库:https://huggingface.co/collections/AngelSlim/angelspec
九、总结
AngelSpec是腾讯推出的一体化投机解码草稿模型训练工具链,整合了当下多种主流Drafter模型训练方案,补齐了现有开源工具架构单一、缺少在线评测、无法实现训推集群解耦的短板,兼顾科研实验快速迭代与线上大模型推理业务工程落地需求,开发者依托这套框架能够快速训练适配自有大模型的草稿模型,借助投机解码技术有效降低LLM推理延迟、提升服务整体吞吐。
版权及免责申明:本文由@人工智能研究所原创发布。该文章观点仅代表作者本人,不代表本站立场。本站不承担任何相关法律责任。
如若转载,请注明出处:https://www.aipuzi.cn/ai-news/angelspec.html

