ARTICLE · 人工智能

DeepSeek Harness 刚开源,阿里长程 Harness 也来了

作者:PaperAgent 来源:PaperAgent 2026-08-15 16:35 11 分钟 9 阅读 2569 字
AI AgentAI 编程开源项目长程任务模型评估
一语总结

阿里开源 LongHorizon-Harness 框架,通过 Manage-Execute-Audit 三段循环解决长程 Agent 任务的状态管理问题,实验显示 Qwen 3.7-Plus 在 WeaveBench 上从 51.8%提升至 80.7%。

AI 总结

本文报道阿里开源的 LongHorizon-Harness 项目,这是一个面向长程 Agent 任务的框架。文章介绍了其核心设计:将长程任务拆分为动态轮次,每轮执行 Manage-Execute-Audit(MEA)循环。Manager 负责读取任务状态和审计报告,构造子任务契约;Executor 在新上下文独立执行,不携带历史轨迹;Auditor 以只读权限独立验证执行结果。实验显示,该框架将 Qwen 3.7-Plus 在 WeaveBench 上的表现从 51.8%提升至 80.7%,Claude Opus 4.7 从 20.0%提升至 34.3%。文章还分析了成本-性能权衡、算力分配以及典型失败模式的修复案例,指出框架主要提升的是任务级下限而非单步能力上限。

核心要点
  1. 长程任务应作为状态管理问题而非单会话处理。

    框架将任务拆分为动态轮次,每轮执行 MEA 循环,避免上下文无限膨胀导致的自我评估失效。

  2. Executor 每轮使用全新上下文,不携带历史轨迹。

    执行者只接收本轮契约信息,episode 结束后轨迹丢弃,只有执行报告被送审,防止历史噪声累积。

  3. Auditor 以只读权限独立验证,阻断虚假完成。

    审计者从排除 Executor 轨迹的新上下文出发,基于环境直接证据判定完成状态,Executor 的自我声明不能直接改变持久状态。

  4. 框架提升的是任务级下限而非单步能力上限。

    Qwen 基线得分≤0.04 的任务全部恢复到 0.30-0.92,说明框架主要帮助模型从失败中恢复,而非提升单步推理能力。

DeepSeek Harness 刚开源,阿里长程 Harness 也来了

本文报道阿里开源的 LongHorizon-Harness 项目,这是一个面向长程 Agent 任务的框架。文章介绍了其核心设计:将长程任务拆分为动态轮次,每轮执行 Manage-Execute-Audit(MEA)循环。Manager 负责读取任务状态和审计报告,构造子任务契约;Executor 在新上下文独立执行,不携带历史轨迹;Auditor 以只读权限独立验证执行结果。实验显示,该框架将 Qwen 3.7-Plus 在 WeaveBench 上的表现从 51.8%提升至 80.7%,Claude Opus 4.7 从 20.0%提升至 34.3%。文章还分析了成本-性能权衡、算力分配以及典型失败模式的修复案例,指出框架主要提升的是任务级下限而非单步能力上限。

文章金句

"

长程执行不该是一条不断变长的轨迹,而应该是一个任务状态管理问题。

"

Executor 的自我声明不会直接改变持久状态——只有当干净的审计证据支持时,一条记录才能被标记为 completed。

"

Agent 能力是模型×Harness 的系统属性:模型决定每轮内动作的质量,Harness 决定这些成果跨轮被多可靠地保留和利用。