ARTICLE · 人工智能

ICML 2026 | 从专才到通才,OmniShow 极简干预统一多模态视频生成

作者:PaperWeekly 来源:PaperWeekly 2026-08-20 19:34 15 分钟 19 阅读 3706 字
AI 视频生成多模态控制极简干预专才到通才OmniShow
一语总结

文章详细解读 ICML 2026 接收的 OmniShow 工作,说明其通过极简干预和从专才到通才的设计哲学,在仅 12.3B 参数、音频模块增幅约 2.5% 的情况下实现多模态视频生成的统一与协同。

AI 总结

文章首先指出业界在多模态视频生成中常采用'缺什么补什么'的做法,导致模块堆砌且稀释基础模型的生成先验。OmniShow 则采取相反路径:深度理解 DiT 基础模型的原生输入结构与学习动态,以最小改动让文本、参考图像、音频和姿态条件顺势并入。在视觉条件上,它复用模型原生的 channel-concat 机制,并通过轻量的 Reference Reconstruction Loss 将保真目标写入优化;音频则采用 Gated Local-Context Attention 与自适应门控,仅使模型增幅约 2.5%。在数据与训练方面,OmniShow 构建多层异构数据流程,先分别训练 R2V 与 A2V 两个专家模型,再通过权重插值融合,随后在完整 RA2V 数据上继续训练并最后引入姿态,实现了从专才到通才的零-shot 能力涌现。文章进一步介绍了 HOIVG-Bench 评测基准,定性与定量结果表明 OmniShow 在多种条件组合下均能保持身份一致、音画同步及动作控制,且在参数效率上显著优于类似方案。最后强调,OmniShow 的价值不仅在于具体技巧,而在于其验证的设计哲学:在强大基础模型面前,克制地判断何时改动、何时保留,才是实现高效统一的成熟路径。

核心要点
  1. OmniShow 通过极简干预让多模态条件顺势进入基础模型。

    文章指出,OmniShow 不新增复杂分支,而是复用 DiT 原生的 channel-concat 机制,将参考图像和姿态通过 VAE 编码后与噪声视频 token 对齐,并用轻量的 Reference Reconstruction Loss 将保真目标写入优化,使任务适配差距极小。

  2. 音频模块采用自适应门控的 Gated Local-Context Attention,仅增幅约 2.5%。

    OmniShow 为连续音频设计 Gated Local-Context Attention,结合自适应门控(初始化近零)使音频影响缓慢生长,门控范数反过来成为诊断工具,最终仅在 dual-stream blocks 插入,音频模块参数增幅约 2.5%,规模仍为 12.3B。

  3. 通过分阶段训练与权重插值实现从专才到通才的零-shot 能力涌现。

    文章说明 OmniShow 先分别训练 R2V 与 A2V 两个专家模型,再用权重插值(音频模块继承自 A2V,其余参数按 A2V/R2V = 0.6/0.4 融合)合并,随后在完整 RA2V 数据上继续训练并最后引入姿态,合并后模型即涌现出 joint reference-audio 生成能力,验证了可控性可经由 weight merging 涌现。

  4. HOIVG-Bench 评测显示 OmniShow 在多条件协同上表现出色,且参数效率优于同类方案。

    文章介绍 HOIVG-Bench 包含 135 个精选样本,从文本对齐、参考一致、姿态精度、音画同步及视频质量五个维度评测。定量结果表明,在 R2V、RA2V、RP2V 三种设置下,OmniShow 在多项指标上领先或与更大模型(如 Phantom-14B、HuMo-17B)持平,且音频模块仅增幅约 2.5%,体现高性价比。

ICML 2026 | 从专才到通才,OmniShow 极简干预统一多模态视频生成

文章首先指出业界在多模态视频生成中常采用'缺什么补什么'的做法,导致模块堆砌且稀释基础模型的生成先验。OmniShow 则采取相反路径:深度理解 DiT 基础模型的原生输入结构与学习动态,以最小改动让文本、参考图像、音频和姿态条件顺势并入。在视觉条件上,它复用模型原生的 channel-concat 机制,并通过轻量的 Reference Reconstruction Loss 将保真目标写入优化;音频则采用 Gated Local-Context Attention 与自适应门控,仅使模型增幅约 2.5%。在数据与训练方面,OmniShow 构建多层异构数据流程,先分别训练 R2V 与 A2V 两个专家模型,再通过权重插值融合,随后在完整 RA2V 数据上继续训练并最后引入姿态,实现了从专才到通才的零-shot 能力涌现。文章进一步介绍了 HOIVG-Bench 评测基准,定性与定量结果表明 OmniShow 在多种条件组合下均能保持身份一致、音画同步及动作控制,且在参数效率上显著优于类似方案。最后强调,OmniShow 的价值不仅在于具体技巧,而在于其验证的设计哲学:在强大基础模型面前,克制地判断何时改动、何时保留,才是实现高效统一的成熟路径。

文章金句

"

不堆模块,12.3B 做成多模态通才

"

哲学之一·极简干预:让视觉条件'顺势'进来

"

哲学之二·从专才到通才:把异构数据用到极致

"

极简干预不是一种保守妥协,反而更像一种更成熟的扩展观。