AngelSpec:腾讯开源统一投机解码草稿模型训练框架

AI新闻 人工智能研究所
59

一、AngelSpec是什么

AngelSpec 是腾讯混元AI基础设施团队开源、基于PyTorch构建的工业级投机解码(Speculative Decoding)草稿模型全流程训练框架,框架打通训练、在线评估、分布式部署链路,原生适配Qwen、腾讯混元(Hunyuan/Hy3)等主流大模型基座,面向科研人员与大模型线上推理工程团队,解决传统草稿模型训练框架架构碎片化、训练推理割裂、长上下文支持弱、线上真实效果难以验证等痛点。

二、功能特色

  1. 多架构统一训练入口
    单一框架支持6大类主流草稿模型架构,仅修改配置文件即可切换方案,包含DFly、DFlash、DFlare、Eagle3、MTP、DSpark,覆盖块并行、自回归TTT、混合三大技术路线。

  2. 长上下文原生支持
    集成Ulysses序列并行技术,最高支持128k上下文长度训练,内置40k上下文开箱即用训练配置,适配超长文本、文档问答场景下的投机解码优化。

  3. 多样化损失函数组合
    内置CE损失、KL散度、LK损失、D-PACE权重、TV损失等多种目标函数,自由组合调优,提升草稿Token被主模型接受率,直接影响推理加速效果。

  4. 文档感知样本打包机制
    采用Megatron风格定长序列打包,强制隔离不同文档样本,规避跨文档污染问题,MTP、DFlash两条核心训练链路通用。

  5. 训练阶段在线仿真评估
    训练过程可直接对接vLLM/SGLang推理引擎,实时运行真实投机解码流程,输出平均接受长度、逐位置Token接受率等线上核心指标,不再只依赖离线损失判断模型优劣。

  6. 训练/推理集群解耦分布式架构
    依托Mooncake张量存储实现训练集群、推理集群分离部署,两类算力可以独立扩容,满足线上高并发业务持续微调草稿模型的需求。

  7. 完善工程化配套
    提供单节点、多节点分布式训练脚本、环境一键构建脚本、单元测试、完整文档,兼容主流CUDA 12.x环境,支持续训、从零初始化两种训练模式。

AngelSpec(图1)

三、技术细节

3.1 支持的六大草稿模型架构

架构分类 模型名称 核心技术特点 适用场景
块并行架构 DFly 混合条件目标+隐藏状态校正AR头,腾讯主推工业方案 线上高并发生产推理
块并行架构 DFlash 锚点采样+并行分块生成 通用场景,平衡速度与效果
块并行架构 DFlare DFlash基础上增加分层可学习目标融合 追求更高草稿接受率场景
自回归TTT架构 MTP 多头多Token预测,适配MoE基座,支持on-policy滚动训练 MoE大模型基座适配
自回归TTT架构 Eagle3 测试时训练架构,输入特征融合 轻量化、小参数量基座
混合架构 DSpark DFlash主干+EAGLE自回归预测头 兼顾并行生成与自回归特性

3.2 底层核心组件

  1. TorchSpec:框架基础底层,在此之上二次开发实现AngelSpec完整训练逻辑;

  2. Mooncake:张量分布式存储组件,负责训练侧隐状态向推理侧高效传输,实现训推分离;

  3. 推理后端对接层:原生兼容vLLM、SGLang两大主流开源推理引擎,训练中实时仿真投机解码;

  4. 序列并行模块:Ulysses并行实现超长上下文训练显存优化;

  5. 多目标损失调度器:支持动态调整各类损失权重,自动化消融实验。

3.3 核心工作流程

加载基座大模型 → 选定草稿模型架构并初始化 → 文档隔离样本预处理打包 → 多损失联合训练 → 周期性推送权重至推理集群 → 实时运行投机解码评测并记录指标 → 根据指标迭代超参持续训练。

四、应用场景

  1. 大模型线上推理加速
    云厂商、AI服务商部署LLM服务,训练专属Drafter草稿模型,利用投机解码降低Token生成延迟,提升服务吞吐量。

  2. MoE混合专家模型优化
    针对混元Hy3、Qwen MoE等大模型,训练MTP架构草稿模型,缓解MoE推理算力开销大的问题。

  3. 超长文本业务场景
    知识库问答、长文档总结、小说续写等16k~128k上下文业务,训练适配长文本的草稿模型。

  4. 学术科研实验
    研究者快速对比Eagle、MTP、DFlash等多种投机解码方案,统一训练底座,减少重复工程开发。

  5. 私有化大模型部署
    企业本地部署私有大模型,自定义训练适配行业数据的草稿模型,不依赖第三方预训练Drafter。

五、使用方法

5.1 环境准备

框架推荐CUDA 12.x,支持A100、H20等主流GPU。

  1. 克隆项目仓库

git clone https://github.com/Tencent/AngelSpec
cd AngelSpec
  1. 构建运行环境
    可执行项目内置脚本一键构建conda环境

bash build_conda.sh

也可使用本地pip模式安装框架依赖。

额外依赖:Mooncake张量传输组件、vLLM或SGLang推理后端。

5.2 启动训练

项目configs目录提供大量预设配置文件,examples内置开箱即用脚本。

  • 单节点训练示例:Qwen3-8B DFly草稿模型训练

  • 多节点训练示例:混元Hy3大模型分布式训练
    支持命令行参数覆盖配置文件内学习率、训练步数、上下文长度等超参。
    两种训练模式可选:

  1. 从零初始化草稿模型训练;

  2. 加载已有权重持续微调(CPT)。

5.3 效果评估

训练脚本内置评测逻辑,周期性启动投机解码仿真,自动输出关键指标,无需单独离线写评测代码。

AngelSpec(图2)

六、竞品对比

选取当前投机解码训练领域主流开源框架做横向对比

项目名称 AngelSpec(腾讯) Eagle Training Code vLLM Spec Train
开发主体 腾讯混元AI Infra团队 耶鲁大学开源社区 vLLM官方团队
支持Drafter架构 DFly/DFlash/MTP/Eagle3等6种架构 仅Eagle系列架构 原生MTP,架构扩展性有限
训推分离分布式 支持(Mooncake) 不支持,训推同集群 不支持
超长上下文训练 最高128k(Ulysses并行) 有限支持 依赖外部并行方案
训练实时投机评测 原生内置 需要自行开发对接 仅离线损失评估
适配基座 Qwen、Hy3等稠密/MoE模型 稠密通用基座 主流稠密模型,MoE适配较弱
工程配套 完整脚本、配置、单元测试 最简实验代码,工程化薄弱 偏向推理,训练工具链不完善

七、常见问题解答

Q:AngelSpec只能使用腾讯混元大模型吗?

A:不是。框架原生支持Qwen系列模型,同时兼容主流稠密大模型、MoE混合专家模型,任何开源基座只要格式适配,均可用来训练草稿模型。

Q:运行AngelSpec必须搭配vLLM吗?

A:不是。框架同时支持vLLM、SGLang两种推理后端,可以根据自身部署环境自由选择,仅需要安装对应后端依赖包。

Q:Mooncake组件是强制依赖吗?单机训练场景是否可以移除?

A:Mooncake主要用于多集群训推分离场景。单节点小规模训练场景,不需要部署Mooncake,可关闭分布式跨集群通信功能正常运行训练。

Q:AngelSpec训练出来的草稿模型,可以直接在其他推理框架使用吗?

A:模型权重为标准PyTorch格式,导出后可适配支持对应投机解码方案的推理引擎;需要注意架构匹配,DFly、DFlash等自研架构需要推理侧实现对应解码逻辑。

Q:普通消费级显卡能否运行AngelSpec?

A:小规模测试、小基座模型(如8B)可以在高端消费显卡开展实验;正式训练草稿模型、128k长上下文训练,建议使用数据中心专业GPU。

Q:框架是否提供预训练好的草稿模型权重?

A:配套项目AngelSlim发布了多套预训练Drafter权重,包含Hy3、Qwen3-8B适配版本,可直接下载用于推理或二次微调。

八、相关链接

  1. GitHub开源仓库:https://github.com/Tencent/AngelSpec

  2. arXiv论文地址:https://arxiv.org/abs/2607.25852

  3. Hugging Face模型库:https://huggingface.co/collections/AngelSlim/angelspec

九、总结

AngelSpec是腾讯推出的一体化投机解码草稿模型训练工具链,整合了当下多种主流Drafter模型训练方案,补齐了现有开源工具架构单一、缺少在线评测、无法实现训推集群解耦的短板,兼顾科研实验快速迭代与线上大模型推理业务工程落地需求,开发者依托这套框架能够快速训练适配自有大模型的草稿模型,借助投机解码技术有效降低LLM推理延迟、提升服务整体吞吐。

打赏
THE END
作者头像
人工智能研究所
发现AI神器,探索AI技术!