ARTICLE · 人工智能

分享一些 insights|我们为什么会做 dLLM,又能否取代 AR?

作者:大模型智能 来源:大模型智能 2026-08-22 00:00 28 分钟 2 阅读 6909 字
扩散语言模型自回归模型LLaDA模型架构推理优化
一语总结

本文从 LLaDA 系列实践出发,系统分析离散扩散语言模型(dLLM)的边际-联合一致性、token 效率与基础设施成本等核心挑战,论证 dLLM 难以简单取代 AR,更可能与 AR、speculative decoding 融合形成连续谱。

AI 总结

文章以作者团队从 LLaDA-MoE 到 LLaDA 2.2 的实践为线索,对离散扩散语言模型(dLLM)能否取代自回归模型(AR)进行了系统反思。核心论点包括:(1)dLLM 的并行去噪逐位置优化的是边际分布,而联合一致性需要额外保证,作者用 CLAUD/LLADA 双峰示例直观说明逐位置 argmax 可能拼出联合概率近零的字符串;(2)速度优势与联合一致性风险来自同一个旋钮——每次提交 token 数,并给出保证非零联合概率的置信度阈值;(3)实际系统为稳定性逐渐采用 AR 初始化、blockwise 生成、confidence-gated commitment、remasking 等设计,呈现 semi-autoregressive 形态,AR 与 diffusion 实为一条连续谱;(4)dLLM 的真正竞争对象是 AR + speculative decoding + verification(DFlash、DSpark),而非原始逐 token AR;(5)从 scaling 视角看,dLLM 在 token efficiency(mask ratio 0.3-0.8、MTF 多轮 forward)、infrastructure efficiency(likelihood 估计困难、RL 稳定性)方面仍有显著成本;(6)dLLM 更适合 infilling、局部重写、结构化生成等低熵双向任务,长链推理与 agent 场景下 AR 仍更成熟;(7)未来 dLLM 可能沿 interaction model、连续 diffusion、具身等方向演化,与 AR 形成互补而非替代。

核心要点
  1. dLLM 并行去噪学到的是逐位置边际分布,而非联合分布。

    一次 forward 中多个位置的输出组合等价于边际分布乘积,与真实联合分布之间存在 total correlation 缺口。CLAUD/LLADA 示例说明逐位置 argmax 可能拼出联合概率近零的 CLADA。

  2. 速度优势与联合一致性风险来自同一个旋钮:每次提交 token 数。

    提交越多并行度越高,但保证非零联合概率所需的逐位置置信度阈值越接近 1(提交 16 个 token 时阈值 >0.9375)。低熵区域天然适合并行,语义分叉点则需减少并行或引入 verifier。

  3. 实际 dLLM 系统逐渐呈现 semi-autoregressive 形态,AR 与 diffusion 是连续谱。

    AR 初始化、blockwise 生成、块间顺序、confidence-gated commitment、remasking 等设计使系统向 AR 靠拢;block size、commit policy、verifier 共同决定其在谱上的位置。

  4. dLLM 的真正竞争对象是 AR + speculative decoding + verification,而非原始 AR。

    DFlash、DSpark 等工作表明并行预测不必绑定 diffusion pretraining,AR base model 加轻量 draft module 同样可获得并行收益并由 AR verifier 保证一致性。

  5. dLLM 在 token efficiency 与 infrastructure efficiency 上仍有显著成本。

    mask ratio 通常 0.3-0.8 导致显式监督密度低于 AR;MTF 多轮 forward 增加训练时长;likelihood 估计困难使 RL 训练稳定性面临额外挑战。

  6. dLLM 更适合低熵双向任务,长链推理与 agent 场景下 AR 仍更成熟。

    infilling、fill-in-the-middle、结构化生成、代码补全等任务中双向 context 与 revision 是建模优势;长链推理、数学证明、tool use 需要状态持续演化,AR 行为更可控。

分享一些 insights|我们为什么会做 dLLM,又能否取代 AR?

文章以作者团队从 LLaDA-MoE 到 LLaDA 2.2 的实践为线索,对离散扩散语言模型(dLLM)能否取代自回归模型(AR)进行了系统反思。核心论点包括:(1)dLLM 的并行去噪逐位置优化的是边际分布,而联合一致性需要额外保证,作者用 CLAUD/LLADA 双峰示例直观说明逐位置 argmax 可能拼出联合概率近零的字符串;(2)速度优势与联合一致性风险来自同一个旋钮——每次提交 token 数,并给出保证非零联合概率的置信度阈值;(3)实际系统为稳定性逐渐采用 AR 初始化、blockwise 生成、confidence-gated commitment、remasking 等设计,呈现 semi-autoregressive 形态,AR 与 diffusion 实为一条连续谱;(4)dLLM 的真正竞争对象是 AR + speculative decoding + verification(DFlash、DSpark),而非原始逐 token AR;(5)从 scaling 视角看,dLLM 在 token efficiency(mask ratio 0.3-0.8、MTF 多轮 forward)、infrastructure efficiency(likelihood 估计困难、RL 稳定性)方面仍有显著成本;(6)dLLM 更适合 infilling、局部重写、结构化生成等低熵双向任务,长链推理与 agent 场景下 AR 仍更成熟;(7)未来 dLLM 可能沿 interaction model、连续 diffusion、具身等方向演化,与 AR 形成互补而非替代。

文章金句

"

每个 token 单独看都很合理,不代表它们放在一起仍然合理。

"

dLLM 的速度优势和它的联合一致性风险,本质上来自同一个变量:每次前向计算提交多少 token。

"

AR 与 diffusion 并不是两个互斥的端点,而是一条连续谱。

"

dLLM 需要回答的问题已经不再只是'能否比逐 token AR 更快',而是:与 AR base model 加 speculative decoding 相比,完整 dLLM 能否在训练成本、生成质量、延迟和吞吐上提供更好的总体收益?

"

Now this is not the end. It is not even the beginning of the end. But it is, perhaps, the end of the beginning.