ARTICLE · 人工智能
我们如何构建多智能体研究系统
一语总结Anthropic 分享了构建生产级多智能体研究系统的工程经验,涵盖架构、提示词工程、评估和可靠性挑战。
本文详细介绍了 Anthropic 如何为 Claude 构建并上线一个多智能体研究系统,采用编排器-工作器模式:一个主导智能体会生成并行的子智能体,探索查询的不同方面。作者解释了为什么多智能体架构擅长开放式、广度优先的研究任务:内部评估显示,相比单智能体 Claude Opus 4,性能提升了 90.2%,而仅 token 用量一项就能解释 BrowseComp 上 80% 的性能差异。他们分享了八条提示词工程原则,包括像智能体一样思考、教会编排器进行委派、根据查询复杂度调整投入、并行工具调用,以及将扩展思考用作可控草稿本。在评估方面,他们建议立即从小样本开始,使用基于单一评分标准的 LLM-as-judge 提示词,并用人工测试加以补充,以发现诸如对 SEO 优化内容的来源质量偏见等自动化评估可能遗漏的问题。在生产可靠性方面,他们讨论了有状态执行、错误叠加,以及用可恢复工作流取代完全重启的必要性。这篇文章基于具体数字、真实失败模式和可操作的启发式方法,而非抽象建议。
- 多智能体系统通过将工作分布到并行上下文窗口中来扩展性能。
在内部评估中,Anthropic 的多智能体研究系统比单智能体 Opus 4 高 90.2%,仅 token 用量就解释了 BrowseComp 上 80% 的性能差异,验证了并行架构可以胜任超出单智能体极限的任务。
- 提示词工程是协调多智能体行为的主要杠杆。
经过迭代形成了八条原则:模拟智能体以建立心智模型,教会编排器通过详细任务说明进行委派,根据查询复杂度调整投入,仔细设计工具接口,让 Claude 4 自我改进提示词,先从宽泛查询开始再逐步收窄,将扩展思考用作草稿本,以及并行化工具调用。
- 有效的评估需要灵活的方法,评判结果而非规定步骤。
多智能体路径是非确定性的,因此 Anthropic 从约 20 个测试查询开始,使用带评分标准的单一 LLM-as-judge 提示词进行规模化评估,并用人工测试者补充,从而发现了自动化遗漏的 SEO 内容偏见等问题。
- 生产级可靠性要求可恢复状态和优雅的错误处理。
智能体是有状态的,并且会运行很多轮,因此小故障会级联放大。Anthropic 构建了从检查点恢复而非重启的系统,并让模型在工具失败时进行自适应,将 AI 的适应性与确定性保障相结合。
我们如何构建多智能体研究系统
本文详细介绍了 Anthropic 如何为 Claude 构建并上线一个多智能体研究系统,采用编排器-工作器模式:一个主导智能体会生成并行的子智能体,探索查询的不同方面。作者解释了为什么多智能体架构擅长开放式、广度优先的研究任务:内部评估显示,相比单智能体 Claude Opus 4,性能提升了 90.2%,而仅 token 用量一项就能解释 BrowseComp 上 80% 的性能差异。他们分享了八条提示词工程原则,包括像智能体一样思考、教会编排器进行委派、根据查询复杂度调整投入、并行工具调用,以及将扩展思考用作可控草稿本。在评估方面,他们建议立即从小样本开始,使用基于单一评分标准的 LLM-as-judge 提示词,并用人工测试加以补充,以发现诸如对 SEO 优化内容的来源质量偏见等自动化评估可能遗漏的问题。在生产可靠性方面,他们讨论了有状态执行、错误叠加,以及用可恢复工作流取代完全重启的必要性。这篇文章基于具体数字、真实失败模式和可操作的启发式方法,而非抽象建议。
文章金句
"多智能体系统之所以有效,主要是因为它们能帮助投入足够的 token 来解决问题。
"有效的提示词依赖于建立对智能体的准确心智模型,这能让最具影响力的改进变得显而易见。
"针对这些智能体的最佳提示词不只是严格的指令,而是定义分工、解决问题方法和投入预算的协作框架。