ARTICLE · 人工智能

揭开 AI 智能体评估的神秘面纱

作者:Anthropic Engineering 来源:Anthropic Engineering 2026-08-22 03:42 24 分钟 5950 字
AI 智能体评估LLM 评估编程智能体对话智能体
一语总结

Anthropic 工程团队提供了一套全面的 AI 智能体评估框架,涵盖评估结构、评分器类型、能力评估与回归评估,以及面向编程、对话和研究类智能体的实用模式。

AI 总结

本文来自 Anthropic 工程团队,旨在揭开 AI 智能体评估的神秘面纱——这类系统会在多轮交互中使用工具,并根据中间结果动态调整。文章定义了评估的核心组件:任务、试验、评分器(基于代码、基于模型、基于人工)、对话记录、最终结果、测试框架与测试套件。作者解释了评估为何至关重要:它能避免被动式的调试,使模型升级更有信心,并为产品与研究团队建立共同语言。文章区分了能力评估(衡量智能体能做什么,初始通过率较低)与回归评估(防止能力倒退,目标接近 100% 通过率)。随后详细介绍了三类主要智能体的评估模式:编程智能体(使用 SWE-bench Verified 和 Terminal-Bench 等确定性测试,配合用于评估代码质量的 LLM 评分标准)、对话智能体(结合状态检查、工具调用验证、对话记录约束与用于评估交互质量的 LLM 评分标准,通常借助用户模拟 LLM)以及研究智能体(收集、综合并分析信息)。来自 Descript 和 Bolt 的真实案例展示了团队如何从手动测试演进到自动化评估套件。文章还给出了具体的 YAML 示例,展示编程智能体与对话智能体的评分器配置与跟踪指标。

核心要点
  1. 智能体评估需要对完整对话记录和最终结果进行多轮评估,而非仅看最终输出。

    智能体在多轮交互中使用工具,会修改状态并动态适应,错误会不断累积。评估必须捕捉完整的执行轨迹(对话记录)和最终环境状态(结果),使用能够编排工具调用并记录所有交互的测试框架。

  2. 能力评估与回归评估用途不同,两者都应持续维护。

    能力评估针对智能体尚不擅长的任务(初始通过率较低),以推动能力提升。回归评估则守护已建立的能力(接近 100% 通过率)。随着能力评估逐渐成熟,它们会晋升为回归套件,形成持续提升的质量棘轮。

  3. 有效的智能体评估需要将基于代码、基于模型和基于人工的评分器组合使用,与评估目标相匹配。

    基于代码的评分器(快速、客观)验证测试通过、工具调用等确定性结果。基于模型的评分器(灵活、细腻)评估语气、指令遵循等主观质量。基于人工的评分器(黄金标准)用于校准模型评分器。最佳组合取决于智能体类型和任务。

  4. 编程智能体的评估以确定性结果验证为核心,辅以质量评分器。

    SWE-bench Verified 和 Terminal-Bench 等基准通过运行测试套件评分。实践中,单元测试验证正确性,LLM 评分标准评估代码质量,并根据需要加入静态分析和工具调用检查。

  5. 对话智能体的评估需要用户模拟与多维度的质量评估。

    成功标准包括任务完成度(状态检查)、效率(轮次限制)和交互质量(用于评估同理心、清晰度、依据性的 LLM 评分标准)。τ-Bench 和 τ2-Bench 等基准使用第二个 LLM 在多轮场景中模拟真实用户画像。

揭开 AI 智能体评估的神秘面纱

本文来自 Anthropic 工程团队,旨在揭开 AI 智能体评估的神秘面纱——这类系统会在多轮交互中使用工具,并根据中间结果动态调整。文章定义了评估的核心组件:任务、试验、评分器(基于代码、基于模型、基于人工)、对话记录、最终结果、测试框架与测试套件。作者解释了评估为何至关重要:它能避免被动式的调试,使模型升级更有信心,并为产品与研究团队建立共同语言。文章区分了能力评估(衡量智能体能做什么,初始通过率较低)与回归评估(防止能力倒退,目标接近 100% 通过率)。随后详细介绍了三类主要智能体的评估模式:编程智能体(使用 SWE-bench Verified 和 Terminal-Bench 等确定性测试,配合用于评估代码质量的 LLM 评分标准)、对话智能体(结合状态检查、工具调用验证、对话记录约束与用于评估交互质量的 LLM 评分标准,通常借助用户模拟 LLM)以及研究智能体(收集、综合并分析信息)。来自 Descript 和 Bolt 的真实案例展示了团队如何从手动测试演进到自动化评估套件。文章还给出了具体的 YAML 示例,展示编程智能体与对话智能体的评分器配置与跟踪指标。

文章金句

"

好的评估能帮助团队更自信地发布 AI 智能体。没有评估,团队很容易陷入被动循环——只在生产环境中发现问题,而修复一个故障又会引发其他问题。

"

评估让问题和行为变化在影响用户之前就变得可见,其价值会在智能体的整个生命周期中不断累积。

"

能力评估或称'质量评估',回答的是'这个智能体能做好什么?'它应以较低的通过率为起点,针对智能体不擅长的任务,为团队提供攀登的阶梯。回归评估回答的是'智能体是否仍能处理以前能处理的所有任务?',应保持接近 100% 的通过率。

"

当更强大的模型发布时,没有评估的团队需要花费数周时间测试,而拥有评估的竞争对手可以快速判断模型的强项,微调提示词,在数天内完成升级。