ARTICLE · 人工智能
靠这 10 个优化点,我们把 Multi-Agent 工作流成本降了 50%以上
一语总结腾讯工程师基于 AgentLens 度量,围绕「只让 AI 看到需要的上下文」等三原则,对 Multi-Agent 工作流实施 10 项成本优化,全流程 token 成本预估降低 50%~65%。
文章记录腾讯技术工程团队对 AI Agent 驱动全流程开发工作流的 token 成本优化实践。该工作流由 1 个 TL 与 6 个子 Agent 组成,全流程含多个 Wave 与数百轮工具调用,成本高且难以定位。团队先用 AgentLens 度量出六类消耗来源:系统提示词、工具返回信息、读取文件、长期记忆、历史消息与用户提示词,再围绕「让 AI 只看到当前需要的上下文、减少无关上下文、减少重复上下文」三原则,落地渐进式披露、CLI 替代 MCP、MCP 数据获取子 Agent 化、长期记忆按需索引、单 Agent 拆分为多 Agent、Agent 专属配置、代码图谱、稳定前缀、避免重复加载 Skill、rtk 压缩 CLI 输出、工具调用并行化等优化。实测主 Agent 端到端 token 下降 55.5%、轮次减少 47%,单轮 input token 降 38.4%,测试/视觉 Agent 成本降 64%,代码图谱使总 token 降 22.7%,反推全流程预估降本 50%~65%。文章同时解释了 KV Cache/Prompt Cache 机制与 MCP 调用的隐藏推理成本。
- 成本优化的前提是先建立度量,不做按 Wave 粒度的消耗拆分就无法定位问题。
团队先用 AgentLens 按 TraceId/SessionId 追踪消耗,识别出系统提示词、工具返回、历史消息等六类主要来源,后续优化才有依据。
- 三原则核心是让 AI 只看到当前需要的上下文,减少无关与重复上下文。
渐进式披露、长期记忆按需索引、代码图谱等手段都在避免无关内容常驻 context,而稳定前缀与并行化则减少历史被重复打包计费。
- 确定性操作应由脚本执行,大模型只负责真正需要语义理解的部分。
CLI 替代 MCP 后,AI 只需生成 spec 文件,实际执行交给 Playwright CLI,既节省每步骤一次 LLM 推理,又换来可重跑与并行能力。
- 多 Agent 拆分本身有成本,需先做规模预判再决定是否拆分。
6 个 Agent 并行等于同时 6 份系统提示词计费,拆分真正的收益在于切断历史滚雪球并为工具白名单、模型分层、稳定前缀等优化打开空间。
- 最贵的冗余是每个 Agent 各自重新发现同一份信息,信息应上游收集一次再通过文档传递。
避免下游 Agent 重复加载同一份长期记忆或 Skill,直接读技术方案文档拿结论,可显著减少重复常驻的上下文。
靠这 10 个优化点,我们把 Multi-Agent 工作流成本降了 50%以上
文章记录腾讯技术工程团队对 AI Agent 驱动全流程开发工作流的 token 成本优化实践。该工作流由 1 个 TL 与 6 个子 Agent 组成,全流程含多个 Wave 与数百轮工具调用,成本高且难以定位。团队先用 AgentLens 度量出六类消耗来源:系统提示词、工具返回信息、读取文件、长期记忆、历史消息与用户提示词,再围绕「让 AI 只看到当前需要的上下文、减少无关上下文、减少重复上下文」三原则,落地渐进式披露、CLI 替代 MCP、MCP 数据获取子 Agent 化、长期记忆按需索引、单 Agent 拆分为多 Agent、Agent 专属配置、代码图谱、稳定前缀、避免重复加载 Skill、rtk 压缩 CLI 输出、工具调用并行化等优化。实测主 Agent 端到端 token 下降 55.5%、轮次减少 47%,单轮 input token 降 38.4%,测试/视觉 Agent 成本降 64%,代码图谱使总 token 降 22.7%,反推全流程预估降本 50%~65%。文章同时解释了 KV Cache/Prompt Cache 机制与 MCP 调用的隐藏推理成本。
文章金句
"没有度量就没有优化。
"最省钱的调用是不调用。
"省 token 不等于功能降级。
"上游收集一次,通过文档传递。
"最贵的冗余是「每个 Agent 各自重新发现同一份信息」。