ARTICLE · 人工智能
VDN-MiniMax-H3 开源:全新混合注意力加速视频生成,8 步生成,近乎无损画质
一语总结OpenVDN 团队开源 VDN-Minimax-H3(VDN-H3),基于 MiniMax-H3,通过混合局部 Softmax 和线性注意力、少步蒸馏,实现 8 步生成 14.4 秒 768p 视频,耗时仅 11.23 秒,画质接近 50 步 Dense H3。
VDN-H3 采用混合注意力机制,将视频 Token 的局部交互保留为精确的 Softmax,而远距离上下文则通过双向线性注意力处理,从而在保持高保真度的同时大幅降低计算复杂度。模型经过三阶段适配(A1、A2、B),最终在 8 张 B200 上以 8 步完成去噪,速度是原始 Dense H3 的 10 倍以上,且视觉质量可与 50 步原始模型媲美。官方提供完整权重、训练代码和优化后的推理实现,支持单机和多机分布式部署。
- 混合注意力架构
VDN-H3 将视频帧的注意力计算分为两部分:局部区域使用精确的 Softmax 注意力,而远距离上下文则通过双向线性注意力处理,这种混合方式既保留了局部细节,又大幅降低了计算复杂度。
- 少步蒸馏与加速
通过专门的训练阶段(A1、A2、B),模型学会了在仅 8 个去噪步骤内生成高质量视频,相比原始的 50 步 Dense H3,速度提升了 6 倍,而画质损失微乎其微。
- 硬件优化与部署
官方提供了针对 NVIDIA B200 的优化配置,并支持单机和多机分布式推理。在 8 张 B200 上,生成一段 14.4 秒的 768p 视频仅需 11.23 秒,实现了“生成速度快过播放时长”的里程碑。
VDN-MiniMax-H3 开源:全新混合注意力加速视频生成,8 步生成,近乎无损画质
VDN-H3 采用混合注意力机制,将视频 Token 的局部交互保留为精确的 Softmax,而远距离上下文则通过双向线性注意力处理,从而在保持高保真度的同时大幅降低计算复杂度。模型经过三阶段适配(A1、A2、B),最终在 8 张 B200 上以 8 步完成去噪,速度是原始 Dense H3 的 10 倍以上,且视觉质量可与 50 步原始模型媲美。官方提供完整权重、训练代码和优化后的推理实现,支持单机和多机分布式部署。
文章金句
"{"point":"VDN-H3 使用 8 张 NVIDIA B200,以 8 步完成一段约 14.4 秒、768p 视频的去噪,耗时 11.23 秒。","explanation":"该引用展示了 VDN-H3 的核心性能优势:在保持高分辨率和长时长的同时,将生成时间从分钟级压缩到秒级,这在视频生成领域是一个重大突破。"}
"{"point":"在单卡 B200、50 步的对比中,模型卡报告 Dense MiniMax-H3(cuDNN)耗时 13.95 分钟,VDN-H3 FP8 为 5.3 分钟。","explanation":"即使在单卡配置下,VDN-H3 也比原始模型快了近 3 倍,证明了其架构优化和蒸馏策略的有效性,使得实时或近实时视频生成成为可能。"}