ARTICLE · 人工智能

美团智播——数字人直播技术创新与实践

作者:美团 · 技术团队 来源:美团 · 技术团队 2026-09-03 18:42 28 分钟 13 阅读 6907 字
数字人直播多模态AIAI Agent大语言模型 (LLM)扩散模型
一语总结

美团智播系统性地解决了数字人直播从形象高保真、动作自然、语音协调到高效推理的全链路技术难题,实现了从「能用」到「规模化商用」的跃升,并已在本地生活场景中落地验证商业价值。

AI 总结

本文介绍美团智播——面向本地生活场景的 AI 数字人直播解决方案。文章围绕商家面临的准入门槛高、时效性要求苛刻、形象内容同质化、规模化部署成本高等业务困境,以及形象高保真、动作自然多样、语音语义协调、规模化推理效率四大技术挑战,系统阐述了解决方案。核心技术包括:SDIP 结构解耦身份个性化与 SREdit 自奖励精准编辑实现高保真形象生成;MoTiGA 多级因果 LLM 动作生成实现文本驱动的流畅动作;StreamingTalk 流式共语动作生成实现语音与手势的语义级协调;Glance2Gaze 扫视融合与注视压缩实现 75% Token 压缩率与 2.5 倍推理加速。系统层面构建了实时交互引擎与内容量产引擎的双引擎架构,并配套「形象-动作-场景」三维解耦的知识库体系。产品在本地生活场景已规模化落地,定制化成本降低超 10 倍,商家闲时交易额平均提升 7.3%,整体开播效率提升 60%。

核心要点
  1. 数字人直播商业化面临业务与技术的多重瓶颈

    业务层面存在准入门槛高、真人主播排班无法满足分钟级响应、形象内容同质化、万路并发推理成本高昂等问题;技术层面需同时解决形象高保真、动作自然多样、语音手势语义协调、实时高效推理四个相互交织的挑战。

  2. SDIP 与 SREdit 协同解决形象高保真与灵活编辑的矛盾

    SDIP 通过结构残差注入将身份特征以残差形式融入,配合空间解耦正则化损失和区域动态掩码,实现身份与姿态的精确分离;SREdit 将编辑指令原子化,并通过空间奖励重加权平衡编辑质量与身份保真,同一模型承担编辑器与评判器角色避免 reward hacking,被 ACM MM 2026 收录。

  3. MoTiGA 将大语言模型的自回归范式引入人体动作生成

    通过将 RVQ-VAE 的卷积替换为因果卷积消除训练-推理不一致,重建 FID 从 0.114 降至 0.031;利用量化层间时间滞后因果依赖实现并行生成,推理效率提升 K 倍;引入业界首个动作生成人类偏好优化(MHPO),在 HumanML3D 上 FID 为 0.041,较基线降低 82.3%,被 CVPR 2026 收录。

  4. StreamingTalk 首次实现非自发性协调动作的流式生成

    通过下三角时间步调度将全序列去噪转化为逐 chunk 渐进输出,推理延迟与总时长无关;采用 Self-Forced Clean Anchoring 策略弥合训练-推理分布差异,配合尾部偏置采样保障长序列稳定性;每 chunk 可绑定独立动作标签实现动态表演风格切换,已投稿 AAAI 2027。

  5. Glance2Gaze 通过扫视融合与注视压缩实现高效视觉推理

    Glance Fusion 将 ViT 不同深度层特征聚合,在不增加 token 数量前提下获得更丰富的视觉表征;Gaze Compression 将压缩模块嵌入 LLM decoder 层实现渐进式压缩(576→288→144),利用语义理解智能判断信息冗余,兼容 FlashAttention-2。最终实现 75% token 压缩率、性能损失<2%、推理加速 2.5 倍、并发成本降低 60%+,被 NeurIPS 2025 收录。

  6. 双引擎架构与知识体系支撑规模化产品落地

    实时交互引擎实现全双工通信与流水线并行调度,压缩端到端延迟;内容量产引擎采用创意-检索-思考-生成-评测五阶段多智能体协同,将视频生成时间从数小时缩短至分钟级;「穿搭美学库-直播专家知识库-AI 运营大脑」三大知识库与「形象-动作-场景」三维解耦架构使个性化直播组合复用成为可能。

美团智播——数字人直播技术创新与实践

本文介绍美团智播——面向本地生活场景的 AI 数字人直播解决方案。文章围绕商家面临的准入门槛高、时效性要求苛刻、形象内容同质化、规模化部署成本高等业务困境,以及形象高保真、动作自然多样、语音语义协调、规模化推理效率四大技术挑战,系统阐述了解决方案。核心技术包括:SDIP 结构解耦身份个性化与 SREdit 自奖励精准编辑实现高保真形象生成;MoTiGA 多级因果 LLM 动作生成实现文本驱动的流畅动作;StreamingTalk 流式共语动作生成实现语音与手势的语义级协调;Glance2Gaze 扫视融合与注视压缩实现 75% Token 压缩率与 2.5 倍推理加速。系统层面构建了实时交互引擎与内容量产引擎的双引擎架构,并配套「形象-动作-场景」三维解耦的知识库体系。产品在本地生活场景已规模化落地,定制化成本降低超 10 倍,商家闲时交易额平均提升 7.3%,整体开播效率提升 60%。

美团技术团队完整拆解数字人直播从形象生成、动作驱动到流式推理的全链路方案,每个模块都有方法细节与可核对指标:定制成本降低超 10 倍、闲时交易额平均提升 7.3%。一线大厂生产级 AI 系统复盘,适合关注多模态与数字人落地的工程师与产品人。

文章金句

"

数字人直播为上述问题提供了新思路,但要真正达到规模化商业可用,远非简单的视频生成任务,面临四大相互交织的技术挑战。

"

现有技术能生成与节奏同步的自发性动作(点头、摆手),但无法产生与语义精准绑定的协调性手势。如何跨越语音与动作之间的「语义鸿沟」,是互动体验升级的关键瓶颈。

"

MoTiGA 观察到 RVQ 不同量化层间存在时间滞后因果依赖——粗粒度层可直接指导细粒度层预测。基于这一观察,设计了多级因果预测架构,不同量化层 token 可并行生成,推理效率提升 K 倍。

"

Glance2Gaze 实现了 75%的视觉 token 压缩(576→144),模型在各项视觉理解任务上的性能损失控制在 2%以内,推理速度提升 2.5 倍,将并发成本降低了 60%以上。

"

这种多智能体协同架构使得内容生产实现了「工业化流水线」模式,单条商品讲解视频的生成时间从人工制作的数小时缩短至分钟级。