ARTICLE · 人工智能
DeepSeek Harness 刚开源,阿里长程 Harness 也来了
一语总结阿里开源 LongHorizon-Harness 框架,通过 Manage-Execute-Audit 三段循环解决长程 Agent 任务的状态管理问题,实验显示 Qwen 3.7-Plus 在 WeaveBench 上从 51.8%提升至 80.7%。
本文报道阿里开源的 LongHorizon-Harness 项目,这是一个面向长程 Agent 任务的框架。文章介绍了其核心设计:将长程任务拆分为动态轮次,每轮执行 Manage-Execute-Audit(MEA)循环。Manager 负责读取任务状态和审计报告,构造子任务契约;Executor 在新上下文独立执行,不携带历史轨迹;Auditor 以只读权限独立验证执行结果。实验显示,该框架将 Qwen 3.7-Plus 在 WeaveBench 上的表现从 51.8%提升至 80.7%,Claude Opus 4.7 从 20.0%提升至 34.3%。文章还分析了成本-性能权衡、算力分配以及典型失败模式的修复案例,指出框架主要提升的是任务级下限而非单步能力上限。
- 长程任务应作为状态管理问题而非单会话处理。
框架将任务拆分为动态轮次,每轮执行 MEA 循环,避免上下文无限膨胀导致的自我评估失效。
- Executor 每轮使用全新上下文,不携带历史轨迹。
执行者只接收本轮契约信息,episode 结束后轨迹丢弃,只有执行报告被送审,防止历史噪声累积。
- Auditor 以只读权限独立验证,阻断虚假完成。
审计者从排除 Executor 轨迹的新上下文出发,基于环境直接证据判定完成状态,Executor 的自我声明不能直接改变持久状态。
- 框架提升的是任务级下限而非单步能力上限。
Qwen 基线得分≤0.04 的任务全部恢复到 0.30-0.92,说明框架主要帮助模型从失败中恢复,而非提升单步推理能力。
DeepSeek Harness 刚开源,阿里长程 Harness 也来了
本文报道阿里开源的 LongHorizon-Harness 项目,这是一个面向长程 Agent 任务的框架。文章介绍了其核心设计:将长程任务拆分为动态轮次,每轮执行 Manage-Execute-Audit(MEA)循环。Manager 负责读取任务状态和审计报告,构造子任务契约;Executor 在新上下文独立执行,不携带历史轨迹;Auditor 以只读权限独立验证执行结果。实验显示,该框架将 Qwen 3.7-Plus 在 WeaveBench 上的表现从 51.8%提升至 80.7%,Claude Opus 4.7 从 20.0%提升至 34.3%。文章还分析了成本-性能权衡、算力分配以及典型失败模式的修复案例,指出框架主要提升的是任务级下限而非单步能力上限。
文章金句
"长程执行不该是一条不断变长的轨迹,而应该是一个任务状态管理问题。
"Executor 的自我声明不会直接改变持久状态——只有当干净的审计证据支持时,一条记录才能被标记为 completed。
"Agent 能力是模型×Harness 的系统属性:模型决定每轮内动作的质量,Harness 决定这些成果跨轮被多可靠地保留和利用。