ARTICLE · 人工智能

DeepMind 又改 Transformer 了:深层激活回流,小模块反超全量微调

作者:PaperWeekly 来源:PaperWeekly 2026-08-20 19:34 11 分钟 17 阅读 2699 字
LLMTransformer模型训练与推理AI 模型模型架构
一语总结

DeepMind 提出 Recirculation 机制,通过在不改动权重的情况下让深层激活回流到浅层,显著提升语言建模性能,甚至可超越全量微调。

AI 总结

文章详细介绍了 DeepMind 最新的 Recirculation 工作:基础 Transformer 权重保持冻结,仅在推理阶段打通从深层到浅层的信息回路,使已经形成的语义状态能够被后续 token 重复利用。为了让回流强度随 token 和隐藏维度自适应,研究团队加入了一个小型 MLP,根据当前 token 在源层和目标层的表示逐维预测回流系数。实验表明,在 Gemma3 1B/4B/12B 上,自适应逐维回流(Adaptive Recirculation)在九个语言建模数据集上的平均困惑度降幅达到 23.0%,略高于对同等结构进行全量微调后的 21.6%;固定系数版本仅提升 8.5%。该方法在多种 Transformer 架构(Qwen3、Pythia、Ministral、Phi2)上均观察到有效的源层‑目标层组合,但未针对性归一化和回流强度优化时收益显著下降。回流影响随 token 距离衰减,但在 256 token 内仍可检测到,且对副词、形容词、动词提升更明显。在指令遵循等下游任务上也见到适度提升,但效果受任务和设置影响较大。文章指出,Recirculation 并非直接替代微调的通用方案,但证明了冻结权重后通过改变内部状态传播方式同样可以释放新的性能空间。

核心要点
  1. Recirculation 通过深层激活回流提升语言建模性能,无需修改模型权重。

    机制在于从较深的源层读取激活并注入较浅的目标层,形成信息回路,使后续 token 能够利用已经在深层完成的语义状态更新。

  2. 自适应逐维回流(Adaptive Recirculation)优于固定系数,在 Gemma3 上平均困惑度降幅达 23.0%,略超全量微调。

    通过小型 MLP 根据当前 token 在源层和目标层的表示动态生成逐维回流系数,实验表明此方案优于标量或固定向量控制,且接近甚至超过全量微调的效果。

  3. 方法在多种 Transformer 架构上均有效,但收益依赖于对应架构的归一化和回流强度的重新优化。

    在 Qwen3 1.7B、Pythia 1B、Ministral 3B、Phi2 2.7B 等模型家族中都观察到有效的源层‑目标层组合;未针对性调优时收益低于 0.5%,说明需要架构特定的超参数调整。

  4. 回流影响随 token 距离衰减,但在 256 token 内仍可测到,且对副词、形容词、动词提升更明显。

    研究追踪单个 token 回流后的影响发现衰减曲线,且不同词性受益程度不同,说明该机制具有时空和语义选择性,对内容词提升更显著。

DeepMind 又改 Transformer 了:深层激活回流,小模块反超全量微调

文章详细介绍了 DeepMind 最新的 Recirculation 工作:基础 Transformer 权重保持冻结,仅在推理阶段打通从深层到浅层的信息回路,使已经形成的语义状态能够被后续 token 重复利用。为了让回流强度随 token 和隐藏维度自适应,研究团队加入了一个小型 MLP,根据当前 token 在源层和目标层的表示逐维预测回流系数。实验表明,在 Gemma3 1B/4B/12B 上,自适应逐维回流(Adaptive Recirculation)在九个语言建模数据集上的平均困惑度降幅达到 23.0%,略高于对同等结构进行全量微调后的 21.6%;固定系数版本仅提升 8.5%。该方法在多种 Transformer 架构(Qwen3、Pythia、Ministral、Phi2)上均观察到有效的源层‑目标层组合,但未针对性归一化和回流强度优化时收益显著下降。回流影响随 token 距离衰减,但在 256 token 内仍可检测到,且对副词、形容词、动词提升更明显。在指令遵循等下游任务上也见到适度提升,但效果受任务和设置影响较大。文章指出,Recirculation 并非直接替代微调的通用方案,但证明了冻结权重后通过改变内部状态传播方式同样可以释放新的性能空间。

文章金句

"

DeepMind 最新工作证明,优化大模型未必需要继续堆参数。改变 Transformer 内部状态传播方式,同样可以释放新的性能空间。

"

这套机制被称为 Recirculation 。它针对的是 Transformer 一个长期存在的结构限制。

"

更重要的是,这一机制无需修改原模型权重,基础版本甚至可以直接作用于已经训练好的模型。

"

Gemma3 主体权重依旧冻结,在 9 个语言建模数据集上,平均困惑度降幅达到 23.0% ,略高于全量微调的 21.6% 。

"

最终的 Adaptive Recirculation 在 9 个语言建模数据集上的平均困惑度降幅达到 23.0% 。固定基础版本为 8.5% ,对加入回流结构的 Gemma3 1B 进行全量微调后达到 21.6% 。