ARTICLE · 人工智能

SGLang 推出 Weight Cache Daemon,实现亚秒级引擎重启 · AIHOT

作者:noreply@aihot.virxact.com (LMSYS:Blog(Chatbot Arena 团队)) 来源:AIHOT — 精选 2026-08-22 01:56 18 分钟 3 阅读 4290 字
LLMAI 基础设施模型服务推理优化CUDA IPC
一语总结

SGLang 推出 Weight Cache Daemon,以常驻 GPU 进程和 CUDA IPC 零拷贝共享量化权重,将大模型引擎权重加载从数分钟降至亚秒,端到端启动时间减少约 94%。

AI 总结

本文介绍 SGLang 团队发布的 Weight Cache Daemon(权重缓存守护进程)。随着 Qwen3-235B、Ling-2.6-1T 等超大模型普及,LLM 服务冷启动成本急剧上升;对 Ling-2.6-1T FP8 的剖析显示,从磁盘加载权重约占启动时间 93.9%。方案在每个 GPU 上运行常驻守护进程,将 TP 分片、量化后的权重保留在显存,通过 CUDA IPC 句柄将同一块物理内存零拷贝映射给新引擎实例,并引入 CacheConfig 指纹校验与量化方法白名单,避免映射不兼容权重。实测权重加载从约 495 秒降至约 0.63 秒(约 785 倍加速),端到端启动时间减少 93.9%。文章还给出单机/多机部署命令,以及多实例权重共享、优先级协同服务、主备故障切换等生产场景,并披露冷启动小于 10 秒、热备切换小于 1 秒的后续路线图。

核心要点
  1. 磁盘加载权重是 LLM 冷启动的最大瓶颈,占比约 93.9%。

    对 Ling-2.6-1T FP8 的剖析显示,权重读取、反序列化与量化后处理消耗约 495 秒,其余阶段合计仅约 30 秒,消除磁盘 I/O 是优化关键。

  2. Weight Cache Daemon 通过 CUDA IPC 零拷贝实现亚秒级权重加载。

    常驻 GPU 进程预先加载并量化权重,引擎在 meta 设备上初始化模型后直接映射同一块物理显存,不复制数据;实测权重加载从约 495 秒降至约 0.63 秒。

  3. 配置指纹校验与量化白名单保证共享权重的正确性。

    模型路径、TP/PP/DP 尺寸、量化方式、dtype、GPU 架构与 torch 版本任一不匹配都会触发磁盘重载或明确报错,避免映射不兼容权重产生错误结果。

  4. 多实例共享与主备切换让故障恢复不必复制整套 GPU 资源。

    同一守护进程可同时供多个引擎实例与高低优先级任务使用;主引擎故障时备机可在 1 秒内接管,无需为空闲副本保留整组 GPU。

SGLang 推出 Weight Cache Daemon,实现亚秒级引擎重启 · AIHOT

本文介绍 SGLang 团队发布的 Weight Cache Daemon(权重缓存守护进程)。随着 Qwen3-235B、Ling-2.6-1T 等超大模型普及,LLM 服务冷启动成本急剧上升;对 Ling-2.6-1T FP8 的剖析显示,从磁盘加载权重约占启动时间 93.9%。方案在每个 GPU 上运行常驻守护进程,将 TP 分片、量化后的权重保留在显存,通过 CUDA IPC 句柄将同一块物理内存零拷贝映射给新引擎实例,并引入 CacheConfig 指纹校验与量化方法白名单,避免映射不兼容权重。实测权重加载从约 495 秒降至约 0.63 秒(约 785 倍加速),端到端启动时间减少 93.9%。文章还给出单机/多机部署命令,以及多实例权重共享、优先级协同服务、主备故障切换等生产场景,并披露冷启动小于 10 秒、热备切换小于 1 秒的后续路线图。

文章金句

"

无论有多少实例消费权重,权重都仅从磁盘加载并量化一次。

"

引擎和守护进程通过 CUDA IPC 共享同一块物理 GPU 内存。

"

这实现了近乎零宕机的故障切换,而无需将整组 GPU 专门用于空闲副本,避免了传统热备部署中昂贵的 GPU 资源浪费。

"

Weight Cache Daemon 是我们快速引擎恢复框架的第一阶段,该框架的目标是为生产环境中的 LLM 服务实现冷启动小于 10 秒、热备切换小于 1 秒。