ARTICLE · 人工智能

Ora 如何在 Vercel 上对每个主流 AI 智能体进行基准测试 | 客户案例 | Vercel

作者:Susan Aziz、Kevin Sundstrom 来源:Vercel News 2026-08-22 05:00 5 分钟 2 阅读 1050 字
AI 智能体LLMVercel基准测试智能体框架
一语总结

Ora 借助 Vercel 在真实网站上测试主流 AI 智能体,揭示就绪度差距并优化自身框架。

AI 总结

Ora 在 Vercel 上运行一个基准测试平台,让主流 AI 智能体——Claude Code、ChatGPT、Gemini、Hermes、OpenClaw 以及 Vercel 自家的 eve——在实际客户站点上同台竞技。通过追踪每个测试框架的步骤数、成本、延迟和成功率,Ora 揭示了智能体的失败之处,并表明 99% 的网站尚未为智能体做好准备。该基准测试也反馈给了 eve,发现了一个提示词缓存问题,修复后成本下降了约 15%。

核心要点
  1. Ora 提供了一个统一的 Vercel 平台,用于端到端的智能体测试。

    Ora 将前端、后端和智能体运行时都托管在 Vercel 上,从而消除了独立基础设施,并让智能体与产品其他部分使用相同的部署路径、日志和身份验证。

  2. 基准测试显示 eve 在关键指标上优于 Claude Code。

    在数百次真实任务中,eve 所用的步骤数减少了 7%,原生成功率翻倍,并多发现 9% 的有效端点;修复提示词缓存问题后,这些洞见还使 eve 的总成本降低了 ~15%。

  3. 测试表明,99% 的网站尚未为 AI 智能体做好准备。

    由于测试框架的预期与实际网站不匹配,智能体在真实站点上经常失败,这表明大多数网站缺乏可靠的智能体驱动注册、集成和支付所需的基础设施。

  4. Ora 的工程团队利用与 Vercel 集成的编码智能体,每天进行数百次提交。

    借助整合的技术栈,编码智能体可以处理日志、调试、部署和环境变量变更,每周为工程师节省数小时,并提高生产力。

Ora 如何在 Vercel 上对每个主流 AI 智能体进行基准测试 | 客户案例 | Vercel

Ora 在 Vercel 上运行一个基准测试平台,让主流 AI 智能体——Claude Code、ChatGPT、Gemini、Hermes、OpenClaw 以及 Vercel 自家的 eve——在实际客户站点上同台竞技。通过追踪每个测试框架的步骤数、成本、延迟和成功率,Ora 揭示了智能体的失败之处,并表明 99% 的网站尚未为智能体做好准备。该基准测试也反馈给了 eve,发现了一个提示词缓存问题,修复后成本下降了约 15%。

文章金句

"

你在 eve 上无需过多配置,它开箱即用,与其他测试框架的一致性令人惊叹。

"

按照 Ora 自己的衡量标准,99% 的网站仍然无法应对一个要注册、集成并支付的智能体。

"

所有内容都整合到同一套基础设施中,这让我们的编码智能体效率大大提高。我甚至不需要登录 Vercel 的界面。我让编码智能体去查看日志、调试一切、部署代码、修改环境变量。

"

我从这项技术刚出现时就开始构建智能体,eve 是我经历过的最简单的上手体验。