LLaDA2.X:蚂蚁集团开源的离散扩散大语言模型
一、LLaDA2.X 是什么
LLaDA2.X 是蚂蚁集团 InclusionAI 团队开源的离散扩散大语言模型(dLLM) 完整系列项目,产品线包含三代迭代版本:LLaDA2.0、LLaDA2.1、LLaDA2.2,覆盖16B轻量mini规格与100B超大flash规格,是全球首个实现百亿参数规模落地的扩散架构大语言模型。
区别于GPT、Qwen这类传统自回归(AR)大模型逐token串行生成逻辑,LLaDA2.X基于文本离散扩散范式,依靠并行解码实现生成提速,同时持续迭代文本编辑、智能体交互能力,兼顾学术研究与工业落地需求。

二、功能特色
高速并行文本生成
内置CAP置信感知并行解码方案,配套自研dInfer+SGLang推理引擎,最高吞吐可达535 token/s,对比同参数自回归模型生成速度提升2倍以上,长文本、批量推理场景优势显著。全维度文本编辑能力
版本迭代持续完善文本修改逻辑:2.1仅支持原位token替换,2.2新增序列插入、删除、改写全量编辑能力,支持对已生成文本局部纠错、扩充、删减,无需重新整段生成。原生超长上下文支持
全系模型原生支持128K上下文窗口,长文档总结、长篇代码、多轮超长对话、知识库检索问答场景无截断压力。专项强化智能体Agent能力
LLaDA2.2搭载L-EBPO扩散模型专属强化学习算法,可接收环境反馈完成迭代纠错,在工具调用、数据库查询、复杂任务规划等Agent基准测试中大幅缩小与自回归模型差距。顶尖代码生成性能
100B规格LLaDA2.0-flash HumanEval评测得分94.5,代码补全、算法编写、工程脚本生成能力优于同期多款主流开源自回归大模型。轻量化&超大双规格覆盖
提供16B mini轻量化版本适配本地单机部署,100B flash大规格满足企业高精度生产需求,附带CAP加速优化专用权重包。全链路开源无限制
模型权重、训练脚本、推理加速代码、学术论文、技术报告全部公开,商用、二次开发无闭源限制。
三、技术细节
3.1 核心架构:离散扩散语言模型
传统自回归模型按顺序逐个输出token,存在串行性能瓶颈;LLaDA2.X采用离散文本扩散机制,将文本生成转化为噪声去噪迭代过程,单次迭代可并行更新全部token,从底层提升生成并发效率。
3.2 三代版本核心技术迭代
| 版本 | 发布时间 | 核心技术创新 | 核心能力升级 |
|---|---|---|---|
| LLaDA2.0 | 2025.11 | MoE混合专家架构、CAP并行解码 | 首个100B扩散大模型,高速代码生成 |
| LLaDA2.1 | 2026.02 | Token-to-Token原位替换编辑机制、扩散强化学习基础框架 | 基础文本局部修改,双模式解码(极速/高质量) |
| LLaDA2.2 | 2026.07 | Levenshtein莱文斯坦全量编辑、L-EBPO反馈强化学习 | 支持文本增删改,原生Agent工具调用,128K上下文 |
3.3 推理加速技术
CAP置信感知并行:过滤低置信度token,减少无效迭代,大幅降低扩散模型迭代轮次;
dInfer推理引擎:深度适配扩散模型计算逻辑,搭配SGLang实现KV缓存复用、块级调度;
权重优化包:单独提供-CAP加速权重,开箱即用无需二次代码改造。
3.4 训练与优化方案
配套专属扩散模型训练流水线,支持预训练、监督微调SFT、强化学习L-EBPO完整流程;针对扩散模型常见误差累积问题,通过莱文斯坦编辑损失函数约束迭代生成偏差,提升长文本连贯性。

四、应用场景
批量内容生产
短视频文案、小说连载、产品文案批量生成,并行解码大幅降低批量生成耗时,适合内容工作室、新媒体平台。代码开发辅助
算法刷题、工程脚本、前后端代码批量补全,HumanEval高分表现适配程序员本地开发、企业代码中台。超长文档处理
百万字文档总结、合同解析、学术文献梳理,128K上下文无需分段切割文本。AI智能体Agent系统
工具调用、数据库查询、自动化任务规划、客服机器人,2.2版本支持环境反馈实时纠错。本地轻量化部署
16B mini版本可在单卡消费级显卡运行,适合个人开发者、小型企业私有化问答、知识库搭建。学术研究实验
离散扩散大模型方向科研,完整开源训练代码可用于论文复现、新型生成算法研发。
五、使用方法
5.1 环境准备
克隆官方GitHub仓库
git clone https://github.com/inclusionAI/LLaDA2.X cd LLaDA2.X
安装项目依赖
pip install -r requirements.txt
5.2 模型权重获取
所有模型权重托管于Hugging Face Hub,支持自动拉取,主流权重列表:
轻量版:LLaDA2.0-mini、LLaDA2.1-mini
大参数版:LLaDA2.0-flash、LLaDA2.1-flash、LLaDA2.2-flash
加速专用:LLaDA2.0-mini-CAP、LLaDA2.0-flash-CAP
5.3 基础推理调用
项目内置Hugging Face Transformers兼容接口,单轮对话极简调用,同时提供dInfer高速推理启动脚本,支持批量推理、长文本生成、文本编辑模式切换。
5.4 二次训练微调
仓库附带完整预训练、SFT监督微调、L-EBPO强化学习脚本,配置参数文件后即可启动自定义数据集训练,适配行业专属模型微调需求。
六、竞品对比
选取两款主流开源大模型作为对比对象,分别为Qwen3系列(传统自回归通用大模型)、DiffuLLM(初代离散扩散语言模型),从架构、速度、编辑能力、Agent能力、上下文窗口多维度对比:
| 对比维度 | LLaDA2.X | Qwen3(自回归模型) | DiffuLLM(初代扩散模型) |
|---|---|---|---|
| 底层架构 | 离散扩散dLLM,并行解码 | 传统自回归AR,串行逐Token生成 | 初代离散扩散,无并行加速优化 |
| 最高推理速度 | 535 token/s(CAP加速) | 约260 token/s(同参数) | 180 token/s左右 |
| 文本编辑能力 | 2.2支持增/删/改全量编辑 | 仅支持整段重写,无局部编辑 | 仅简单原位替换,无删除插入 |
| Agent智能体性能 | L-EBPO强化学习,多工具适配 | 成熟Agent框架,生态完善 | 无专用强化学习方案 |
| 上下文长度 | 全系原生128K | 最高128K(部分版本需开启扩展) | 固定32K短上下文 |
| 百亿参数落地 | 支持100B MoE超大规格 | 最高72B稠密参数 | 仅支持10B以内小模型 |
| 开源完整度 | 训练+推理+论文全部开源 | 推理开源,完整训练流程未公开 | 仅推理demo开源 |

七、常见问题解答
Q:LLaDA2.X和普通自回归大模型最核心区别是什么?
A:自回归模型只能一个token接着一个token串行输出,生成速度存在天然上限;LLaDA2.X基于离散扩散并行生成,单次迭代可同步优化整段文本全部token,依靠CAP技术大幅压缩生成耗时,同时原生支持局部文本编辑,不用整段重新生成。
Q:本地电脑可以运行LLaDA2.X吗?
A:可以,16B mini轻量化版本支持单张高端消费显卡部署,显存建议≥24G;100B flash大规格需要多卡服务器环境,普通个人设备无法承载。
Q:LLaDA2.X是否可以商用?
A:项目采用Apache 2.0开源协议,允许免费商用、二次开发、模型微调,仅需保留原始开源版权声明,无商用授权费用。
Q:LLaDA2.0、2.1、2.2三个版本该怎么选择?
A:仅做代码生成、基础对话选LLaDA2.0-mini;需要简单文本修改选LLaDA2.1;搭建AI智能体、长文档处理、需要完整文本增删改编辑功能直接选用最新LLaDA2.2-flash。
Q:扩散模型生成文本连贯性会不会比自回归模型差?
A:LLaDA2.2通过莱文斯坦损失函数、L-EBPO强化学习优化了扩散模型误差累积问题,在通用对话、代码、长文本任务上连贯性已追平同参数自回归模型,仅极超长创意文本场景略有差距。
Q:项目提供的CAP加速权重和普通权重有什么差异?
A:CAP权重内置置信感知并行解码优化逻辑,推理速度提升一倍以上,适合批量生成、高并发服务场景;普通权重侧重通用均衡效果,适合科研微调、小规模单次对话。
八、相关链接
GitHub仓库地址:https://github.com/inclusionAI/LLaDA2.X
Hugging Face模型库:
九、总结
LLaDA2.X是蚂蚁InclusionAI团队推出的一套成熟、完整、全链路开源的离散扩散大语言模型解决方案,打破了传统自回归模型在生成速度、文本编辑能力上的固有局限,从16B轻量化单机部署到100B超大规格企业级场景全覆盖,同时配套自研推理加速引擎与专属强化学习框架,兼顾学术科研的可复现性与商业落地的高性能需求,为行业提供了区别于自回归架构的全新大模型开发、部署技术路线。
版权及免责申明:本文由@97ai原创发布。该文章观点仅代表作者本人,不代表本站立场。本站不承担任何相关法律责任。
如若转载,请注明出处:https://www.aipuzi.cn/ai-news/llada2x.html

