ARTICLE · 人工智能

靠这 10 个优化点,我们把 Multi-Agent 工作流成本降了 50%以上

作者:腾讯技术工程 来源:腾讯技术工程 2026-08-21 17:36 33 分钟 6 阅读 8119 字
AI Agent上下文工程LLMMCP 协议AI 编程
一语总结

腾讯工程师基于 AgentLens 度量,围绕「只让 AI 看到需要的上下文」等三原则,对 Multi-Agent 工作流实施 10 项成本优化,全流程 token 成本预估降低 50%~65%。

AI 总结

文章记录腾讯技术工程团队对 AI Agent 驱动全流程开发工作流的 token 成本优化实践。该工作流由 1 个 TL 与 6 个子 Agent 组成,全流程含多个 Wave 与数百轮工具调用,成本高且难以定位。团队先用 AgentLens 度量出六类消耗来源:系统提示词、工具返回信息、读取文件、长期记忆、历史消息与用户提示词,再围绕「让 AI 只看到当前需要的上下文、减少无关上下文、减少重复上下文」三原则,落地渐进式披露、CLI 替代 MCP、MCP 数据获取子 Agent 化、长期记忆按需索引、单 Agent 拆分为多 Agent、Agent 专属配置、代码图谱、稳定前缀、避免重复加载 Skill、rtk 压缩 CLI 输出、工具调用并行化等优化。实测主 Agent 端到端 token 下降 55.5%、轮次减少 47%,单轮 input token 降 38.4%,测试/视觉 Agent 成本降 64%,代码图谱使总 token 降 22.7%,反推全流程预估降本 50%~65%。文章同时解释了 KV Cache/Prompt Cache 机制与 MCP 调用的隐藏推理成本。

核心要点
  1. 成本优化的前提是先建立度量,不做按 Wave 粒度的消耗拆分就无法定位问题。

    团队先用 AgentLens 按 TraceId/SessionId 追踪消耗,识别出系统提示词、工具返回、历史消息等六类主要来源,后续优化才有依据。

  2. 三原则核心是让 AI 只看到当前需要的上下文,减少无关与重复上下文。

    渐进式披露、长期记忆按需索引、代码图谱等手段都在避免无关内容常驻 context,而稳定前缀与并行化则减少历史被重复打包计费。

  3. 确定性操作应由脚本执行,大模型只负责真正需要语义理解的部分。

    CLI 替代 MCP 后,AI 只需生成 spec 文件,实际执行交给 Playwright CLI,既节省每步骤一次 LLM 推理,又换来可重跑与并行能力。

  4. 多 Agent 拆分本身有成本,需先做规模预判再决定是否拆分。

    6 个 Agent 并行等于同时 6 份系统提示词计费,拆分真正的收益在于切断历史滚雪球并为工具白名单、模型分层、稳定前缀等优化打开空间。

  5. 最贵的冗余是每个 Agent 各自重新发现同一份信息,信息应上游收集一次再通过文档传递。

    避免下游 Agent 重复加载同一份长期记忆或 Skill,直接读技术方案文档拿结论,可显著减少重复常驻的上下文。

靠这 10 个优化点,我们把 Multi-Agent 工作流成本降了 50%以上

文章记录腾讯技术工程团队对 AI Agent 驱动全流程开发工作流的 token 成本优化实践。该工作流由 1 个 TL 与 6 个子 Agent 组成,全流程含多个 Wave 与数百轮工具调用,成本高且难以定位。团队先用 AgentLens 度量出六类消耗来源:系统提示词、工具返回信息、读取文件、长期记忆、历史消息与用户提示词,再围绕「让 AI 只看到当前需要的上下文、减少无关上下文、减少重复上下文」三原则,落地渐进式披露、CLI 替代 MCP、MCP 数据获取子 Agent 化、长期记忆按需索引、单 Agent 拆分为多 Agent、Agent 专属配置、代码图谱、稳定前缀、避免重复加载 Skill、rtk 压缩 CLI 输出、工具调用并行化等优化。实测主 Agent 端到端 token 下降 55.5%、轮次减少 47%,单轮 input token 降 38.4%,测试/视觉 Agent 成本降 64%,代码图谱使总 token 降 22.7%,反推全流程预估降本 50%~65%。文章同时解释了 KV Cache/Prompt Cache 机制与 MCP 调用的隐藏推理成本。

文章金句

"

没有度量就没有优化。

"

最省钱的调用是不调用。

"

省 token 不等于功能降级。

"

上游收集一次,通过文档传递。

"

最贵的冗余是「每个 Agent 各自重新发现同一份信息」。