ARTICLE · 人工智能
Ling-3.0-flash 在 4 块 Blackwell GPU 上如何将批处理 1 解码延迟降低 54% · AIHOT
一语总结本文详细介绍了针对 Ling-3.0-flash 在 4 块 NVIDIA Blackwell GPU 上的优化方案,通过主机预取、PDL 链式调度、内核优化和 DSpark 推测解码技术,将批处理 1 解码延迟降低 54%。
本文提出了一套针对 Ling-3.0-flash(一种混合线性注意力 MoE 模型)的全面优化框架,实现了平均每输出 token 时间(TPOT)从 3.33ms 降至 1.53ms(减少 54%),单请求吞吐量从 288 提升至 606 tokens/s。关键优化措施包括:1)主机预取消除 CPU-GPU 同步瓶颈,2)PDL(可编程数据流)链式调度减少 GPU 空闲时间,3)内核融合与 bf16 精度转换(带来约 10% 性能提升),4)DSpark 推测解码在受控测试中达到了 0.78ms 平均 TPOT 和 1120 tokens/s 吞吐量。技术深度分析涵盖性能分析、内存管理及针对批处理 1 场景的架构适配,提供了各优化阶段的详细测量与对比分析。
- 主机预取消除 CPU-GPU 同步瓶颈
通过重构执行流程,使主机操作与 GPU 计算重叠,成功隐藏了 4.3ms 的 CPU 开销于 4.9ms 的 GPU 执行时间内,实现了主机操作的完全隐藏。
- PDL 链式调度减少 GPU 内核启动开销
可编程数据流(PDL)链式调度允许依赖内核在前置内核完全执行前启动,减少内核执行间的空闲时间并提升 GPU 利用率。
- bf16 精度转换带来显著性能提升
将路由门(router gate)和语言模型头(lm_head)从 fp32 迁移到 bf16,减少了 50% 的内存带宽需求,带来约 10% 的性能提升。
- DSpark 推测解码达成纪录性吞吐量
带有接受长度感知优化的 DSpark 实现,在针对 NEXTN 基线的 1000 请求基准测试中达到了 1120 tokens/s 的吞吐量和 0.78ms 的平均 TPOT。
Ling-3.0-flash 在 4 块 Blackwell GPU 上如何将批处理 1 解码延迟降低 54% · AIHOT
本文提出了一套针对 Ling-3.0-flash(一种混合线性注意力 MoE 模型)的全面优化框架,实现了平均每输出 token 时间(TPOT)从 3.33ms 降至 1.53ms(减少 54%),单请求吞吐量从 288 提升至 606 tokens/s。关键优化措施包括:1)主机预取消除 CPU-GPU 同步瓶颈,2)PDL(可编程数据流)链式调度减少 GPU 空闲时间,3)内核融合与 bf16 精度转换(带来约 10% 性能提升),4)DSpark 推测解码在受控测试中达到了 0.78ms 平均 TPOT 和 1120 tokens/s 吞吐量。技术深度分析涵盖性能分析、内存管理及针对批处理 1 场景的架构适配,提供了各优化阶段的详细测量与对比分析。
文章金句
"将路由门和语言模型头从 fp32 迁移到 bf16 是优化后的最大结构变更,带来约 10% 的性能提升。
"大语言模型是助手,而非自主可靠的编码者——我们的优化在推动性能边界的同时,保持严格的正确性校验。