ARTICLE · 人工智能
自进化也能“左脚踩右脚”?Google 最新提出 EnvHarness:环境自进化,倒逼 Agent 疯狂进化!
一语总结文章介绍 Google 提出的 EnvHarness 框架,通过让环境自进化来倒逼 Agent 持续提升,并在 SWE-bench Verified 上实现性能稳步增长。
文章首先阐述 Agent 与环境交互的基本模型,指出现有自进化 Agent 主要依赖单向探索,提出是否可以让环境也随之进化。接着详细描述 EnvHarness 的三个核心组件——开局(Stage)、法则(Contract)和串联(Chain),以及如何通过环境搭建师(EnvRigger)实现观察、诊断、编写、验证的四步闭环,使环境能够根据 Agent 表现动态施压。实验部分展示了在 SWE-bench Verified 基准上,Agent 成功率从 47.67%提升至 54.79%,即使环境数量增加到 300 个,性能曲线仍保持上升趋势,未出现平台。最后列出未来工作方向,包括扩展组件库、拓展至非文本环境和探索语义化组合。全文结构清晰,配有图表和链接,兼顾概念解释与实证结果。
- EnvHarness 通过 Stage、Contract、Chain 三种组件在不修改环境底层的情况下动态调整环境。
开局改变 Agent 的起点状态,法则重写交互规则,串联将多个静态环境首尾相连或动态分支,共同实现环境的可编程施压。
- EnvRigger 采用观察-诊断-编写-验证四步闭环,根据 Agent 轨迹自动生成并测试环境脚手架。
先让 Agent 跑任务收集轨迹,再分析其弱点或捷径,生成对应的 EnvHarness 组件,最后在新环境中验证效果,不合格则迭代修改。
- 实验表明 EnvHarness 能够显著提升 Agent 在 SWE-bench Verified 上的成功率,且随环境数量增加仍保持增长。
Agent 成功率从 47.67%提升到 54.79%,提升 7.12 分;即使环境数量达到 300 个,性能曲线未出现平台,表明持续的螺旋式协同进化。
自进化也能“左脚踩右脚”?Google 最新提出 EnvHarness:环境自进化,倒逼 Agent 疯狂进化!
文章首先阐述 Agent 与环境交互的基本模型,指出现有自进化 Agent 主要依赖单向探索,提出是否可以让环境也随之进化。接着详细描述 EnvHarness 的三个核心组件——开局(Stage)、法则(Contract)和串联(Chain),以及如何通过环境搭建师(EnvRigger)实现观察、诊断、编写、验证的四步闭环,使环境能够根据 Agent 表现动态施压。实验部分展示了在 SWE-bench Verified 基准上,Agent 成功率从 47.67%提升至 54.79%,即使环境数量增加到 300 个,性能曲线仍保持上升趋势,未出现平台。最后列出未来工作方向,包括扩展组件库、拓展至非文本环境和探索语义化组合。全文结构清晰,配有图表和链接,兼顾概念解释与实证结果。
文章金句
"环境就像一个越来越苛刻的顶级陪练。
"Agent 的成功率从最初的 47.67% 一路狂飙至 54.79%(足足涨了 7.12 分)!
"即便环境数量叠加到了 300 个,它的性能增长曲线依然保持着强劲的上升势头,丝毫没有停滞的迹象。