ARTICLE · 人工智能
SGLang 推出 Weight Cache Daemon,实现亚秒级引擎重启 · AIHOT
一语总结SGLang 推出 Weight Cache Daemon,以常驻 GPU 进程和 CUDA IPC 零拷贝共享量化权重,将大模型引擎权重加载从数分钟降至亚秒,端到端启动时间减少约 94%。
本文介绍 SGLang 团队发布的 Weight Cache Daemon(权重缓存守护进程)。随着 Qwen3-235B、Ling-2.6-1T 等超大模型普及,LLM 服务冷启动成本急剧上升;对 Ling-2.6-1T FP8 的剖析显示,从磁盘加载权重约占启动时间 93.9%。方案在每个 GPU 上运行常驻守护进程,将 TP 分片、量化后的权重保留在显存,通过 CUDA IPC 句柄将同一块物理内存零拷贝映射给新引擎实例,并引入 CacheConfig 指纹校验与量化方法白名单,避免映射不兼容权重。实测权重加载从约 495 秒降至约 0.63 秒(约 785 倍加速),端到端启动时间减少 93.9%。文章还给出单机/多机部署命令,以及多实例权重共享、优先级协同服务、主备故障切换等生产场景,并披露冷启动小于 10 秒、热备切换小于 1 秒的后续路线图。
- 磁盘加载权重是 LLM 冷启动的最大瓶颈,占比约 93.9%。
对 Ling-2.6-1T FP8 的剖析显示,权重读取、反序列化与量化后处理消耗约 495 秒,其余阶段合计仅约 30 秒,消除磁盘 I/O 是优化关键。
- Weight Cache Daemon 通过 CUDA IPC 零拷贝实现亚秒级权重加载。
常驻 GPU 进程预先加载并量化权重,引擎在 meta 设备上初始化模型后直接映射同一块物理显存,不复制数据;实测权重加载从约 495 秒降至约 0.63 秒。
- 配置指纹校验与量化白名单保证共享权重的正确性。
模型路径、TP/PP/DP 尺寸、量化方式、dtype、GPU 架构与 torch 版本任一不匹配都会触发磁盘重载或明确报错,避免映射不兼容权重产生错误结果。
- 多实例共享与主备切换让故障恢复不必复制整套 GPU 资源。
同一守护进程可同时供多个引擎实例与高低优先级任务使用;主引擎故障时备机可在 1 秒内接管,无需为空闲副本保留整组 GPU。
SGLang 推出 Weight Cache Daemon,实现亚秒级引擎重启 · AIHOT
本文介绍 SGLang 团队发布的 Weight Cache Daemon(权重缓存守护进程)。随着 Qwen3-235B、Ling-2.6-1T 等超大模型普及,LLM 服务冷启动成本急剧上升;对 Ling-2.6-1T FP8 的剖析显示,从磁盘加载权重约占启动时间 93.9%。方案在每个 GPU 上运行常驻守护进程,将 TP 分片、量化后的权重保留在显存,通过 CUDA IPC 句柄将同一块物理内存零拷贝映射给新引擎实例,并引入 CacheConfig 指纹校验与量化方法白名单,避免映射不兼容权重。实测权重加载从约 495 秒降至约 0.63 秒(约 785 倍加速),端到端启动时间减少 93.9%。文章还给出单机/多机部署命令,以及多实例权重共享、优先级协同服务、主备故障切换等生产场景,并披露冷启动小于 10 秒、热备切换小于 1 秒的后续路线图。
文章金句
"无论有多少实例消费权重,权重都仅从磁盘加载并量化一次。
"引擎和守护进程通过 CUDA IPC 共享同一块物理 GPU 内存。
"这实现了近乎零宕机的故障切换,而无需将整组 GPU 专门用于空闲副本,避免了传统热备部署中昂贵的 GPU 资源浪费。
"Weight Cache Daemon 是我们快速引擎恢复框架的第一阶段,该框架的目标是为生产环境中的 LLM 服务实现冷启动小于 10 秒、热备切换小于 1 秒。