ARTICLE · 人工智能

三次近期故障的事后剖析

作者:Anthropic Engineering 来源:Anthropic Engineering 2026-08-22 03:42 9 分钟 2066 字
AI 工程LLM 服务TPUXLA 编译器模型可靠性
一语总结

Anthropic 工程团队详细介绍了三个相互重叠的基础设施 Bug,这些 Bug 导致 Claude 的回复质量下降。文章解释了它们在不同硬件平台上的根本原因,描述了检测过程中遇到的挑战,并阐述了为防止问题再次发生而在评估、监控和调试方面所做的改进。

AI 总结

2024 年 8 月至 9 月初期间,三个独立的基础设施 Bug 导致 Claude 在其第一方 API、Amazon Bedrock 和 Google Cloud Vertex AI 部署中的回复质量出现间歇性下降。第一个 Bug 是上下文窗口路由错误,它将 Sonnet 4 的请求错误地路由到配置为 100 万 token 上下文窗口的服务器上,峰值时影响了多达 16% 的请求。第二个 Bug 是 TPU 配置错误,导致输出损坏,使 Opus 和 Sonnet 模型在处理英文提示时偶尔出现泰文/中文字符或语法错误。第三个 Bug 源于 token 选择策略的变更,触发了一个潜在的 XLA:TPU 编译器错误编译,主要影响 Claude Haiku 3.5,并可能波及 Sonnet 4 和 Opus 3。由于时间线相互重叠且症状因平台而异,检测工作变得十分困难——现有的基准测试、金丝雀发布以及受隐私限制的日志均未能捕捉到这些微妙且不一致的质量下降。Anthropic 通过修正路由逻辑、回滚 TPU 配置错误,以及放弃近似 top-k 优化、回归精确 top-k 并提升精度来解决每个问题,同时接受轻微的效率损失以保障模型质量。为防止未来再次发生类似事件,团队正在部署更灵敏的评估、对生产系统进行持续质量检查,并改进尊重用户隐私的调试工具,同时强调通过 /bug 命令或点踩按钮直接收集用户反馈的重要性。

核心要点
  1. 三个相互重叠的基础设施 Bug 导致 Claude 在多个硬件平台上的回复出现间歇性质量下降。

    这些 Bug 包括:影响 Sonnet 4 的上下文窗口路由错误、导致 Opus 和 Sonnet 模型输出损坏的 TPU 配置错误,以及主要影响 Haiku 3.5 的近似 top-k XLA:TPU 错误编译。它们的时间线相互重叠且症状因平台而异,导致用户反馈混乱。

  2. 评估体系不完善、隐私控制限制以及症状的不一致性给检测工作带来了阻碍。

    现有的基准测试和金丝雀发布未能捕捉到这些质量下降;用户反馈噪声较大;内部隐私限制使工程师难以检查有问题的交互,从而增加了根因分析的难度。

  3. Anthropic 修复了每个 Bug,强化了评估体系,增加了持续的生产监控,并构建了更好的隐私保护调试工具。

    修复措施包括:修正路由逻辑、回滚 TPU 配置错误、从近似 top-k 采样切换到精确 top-k 采样,以及添加针对意外输出的检测测试。团队还计划部署更灵敏的评估和对线上系统的持续质量检查。

  4. 事后剖析强调模型质量不可妥协,宁可接受轻微的效率损失也要保证正确性,并凸显了直接用户反馈的价值。

    Anthropic 选择精确 top-k 而非近似 top-k,尽管这会带来轻微的性能开销,以确保正确性;同时鼓励用户通过 `/bug` 命令或点踩按钮反馈问题,以便尽早发现未来的故障。

三次近期故障的事后剖析

2024 年 8 月至 9 月初期间,三个独立的基础设施 Bug 导致 Claude 在其第一方 API、Amazon Bedrock 和 Google Cloud Vertex AI 部署中的回复质量出现间歇性下降。第一个 Bug 是上下文窗口路由错误,它将 Sonnet 4 的请求错误地路由到配置为 100 万 token 上下文窗口的服务器上,峰值时影响了多达 16% 的请求。第二个 Bug 是 TPU 配置错误,导致输出损坏,使 Opus 和 Sonnet 模型在处理英文提示时偶尔出现泰文/中文字符或语法错误。第三个 Bug 源于 token 选择策略的变更,触发了一个潜在的 XLA:TPU 编译器错误编译,主要影响 Claude Haiku 3.5,并可能波及 Sonnet 4 和 Opus 3。由于时间线相互重叠且症状因平台而异,检测工作变得十分困难——现有的基准测试、金丝雀发布以及受隐私限制的日志均未能捕捉到这些微妙且不一致的质量下降。Anthropic 通过修正路由逻辑、回滚 TPU 配置错误,以及放弃近似 top-k 优化、回归精确 top-k 并提升精度来解决每个问题,同时接受轻微的效率损失以保障模型质量。为防止未来再次发生类似事件,团队正在部署更灵敏的评估、对生产系统进行持续质量检查,并改进尊重用户隐私的调试工具,同时强调通过 /bug 命令或点踩按钮直接收集用户反馈的重要性。

文章金句

"

我们绝不会因需求、时间或服务器负载而降低模型质量。用户报告的问题完全是由基础设施 Bug 引起的。

"

模型质量不可妥协,因此我们接受了轻微的效率损失。

"

用户继续直接向我们发送反馈仍然特别有帮助。