ARTICLE · 人工智能
Google 重磅发布 Teamwork,最新的多智能体研究!
一语总结Google 开源的 Teamwork 框架通过编排逻辑与 Agent 描述解耦、运行时动态调整规模、以及将失败路径转化为知识积累,解决了多智能体协作中错误强化和脱离轨道的通病,使小模型配合好编排也能在复杂数学问题上达到博士级研究水平。
文章深度解读 Google 开源的 Teamwork 多智能体框架,聚焦其如何解决松散组织的 Agent 会互相强化错误的核心矛盾。框架围绕「生成候选—压力测试—综合—学习」循环,实现了协作模式与 Agent 本身解耦、团队规模动态调整、失败路线留存知识三大设计。文章列举了五种针对不同问题类型的协作模式(迭代精炼、并行工程、数学开放问题、深度验证、论文审查),并以「长证明模式」为例详解策略搜索、分解、锦标赛网络和共享陷阱注册表的完整机制。文中还引用 Anthropic 关于多 Agent 从众效应的研究,强调专门设置反对者角色的必要性。最终结论:多智能体的未来不在堆更大模型,而在编排逻辑质量;Flash-tier 模型也可通过好设计解锁博士级研究能力。
- 多智能体协作的核心矛盾不是「用几个 Agent」,而是「怎么组织它们」,松散组织会导致错误被互相强化。
Anthropic 实验表明,协调 swarm 比独立并行 agents 能找到更多漏洞,差距在复杂任务上更明显。Teamwork 通过让多个 Agent 在数小时甚至数天里互相挑战、找缺陷,把最强部分组合成可用方案来解决这一问题。
- 框架采用「生成—测试—综合—学习」循环,并将协作模式与 Agent 描述解耦,使编排策略可跨领域移植。
模式是规格而非可执行程序,框架读取后自动启动合适 Agent。这样专门的协作机制(如对抗性批评循环)无需改代码即可复用到完全不同领域,Agent 数量和组织方式也在运行中动态调整。
- 针对不同问题结构提供五种专门协作模式,其中「长证明模式」最具创新性。
每种模式匹配一类问题:迭代精炼、并行工程、数学开放问题、深度验证、论文审查。长证明模式通过伪造者机制专门反驳候选策略,将长证明拆为带依赖的子问题并行执行,并用综合树在锦标赛中逐层合成改进方案。
- 失败路线被转化为可复用知识,形成跨轮学习的「陷阱注册表」。
被驳倒的策略附带反对意见保留在过程中,验证者的发现提炼成答案无关的陷阱注册表记录常见错误模式,共享知识目录保存已证明结果、失败方法和相关参考,使后续尝试不再重复踩坑。
- 小模型配合精心设计的编排逻辑,可在复杂开放问题上解锁接近博士级的研究能力。
TCSBench 得分 71% 中有三个结果由 Flash-tier 模型首次产生,证明多智能体的未来不在于堆更大模型,而在于协作机制的设计质量。
Google 重磅发布 Teamwork,最新的多智能体研究!
文章深度解读 Google 开源的 Teamwork 多智能体框架,聚焦其如何解决松散组织的 Agent 会互相强化错误的核心矛盾。框架围绕「生成候选—压力测试—综合—学习」循环,实现了协作模式与 Agent 本身解耦、团队规模动态调整、失败路线留存知识三大设计。文章列举了五种针对不同问题类型的协作模式(迭代精炼、并行工程、数学开放问题、深度验证、论文审查),并以「长证明模式」为例详解策略搜索、分解、锦标赛网络和共享陷阱注册表的完整机制。文中还引用 Anthropic 关于多 Agent 从众效应的研究,强调专门设置反对者角色的必要性。最终结论:多智能体的未来不在堆更大模型,而在编排逻辑质量;Flash-tier 模型也可通过好设计解锁博士级研究能力。
文章金句
"多智能体不是简单把任务分给几个 Agent 就行,怎么让它们协作而不是互相强化错误,是个更难的问题。
"核心矛盾不是「用几个 Agent」,而是「怎么组织它们」。
"不是简单分任务,而是要设计好压力测试机制、结果综合策略、跨轮学习机制。
"失败的草稿保留给下一次尝试。验证者的发现提炼成答案无关的陷阱注册表,记录常见错误模式。
"TCSBench 71% 的得分里,有三个结果是 Flash-tier 模型首次产生博士级别的数学研究。