ARTICLE · 人工智能
Ora 如何在 Vercel 上对每个主流 AI 智能体进行基准测试 | 客户案例 | Vercel
一语总结Ora 借助 Vercel 在真实网站上测试主流 AI 智能体,揭示就绪度差距并优化自身框架。
Ora 在 Vercel 上运行一个基准测试平台,让主流 AI 智能体——Claude Code、ChatGPT、Gemini、Hermes、OpenClaw 以及 Vercel 自家的 eve——在实际客户站点上同台竞技。通过追踪每个测试框架的步骤数、成本、延迟和成功率,Ora 揭示了智能体的失败之处,并表明 99% 的网站尚未为智能体做好准备。该基准测试也反馈给了 eve,发现了一个提示词缓存问题,修复后成本下降了约 15%。
- Ora 提供了一个统一的 Vercel 平台,用于端到端的智能体测试。
Ora 将前端、后端和智能体运行时都托管在 Vercel 上,从而消除了独立基础设施,并让智能体与产品其他部分使用相同的部署路径、日志和身份验证。
- 基准测试显示 eve 在关键指标上优于 Claude Code。
在数百次真实任务中,eve 所用的步骤数减少了 7%,原生成功率翻倍,并多发现 9% 的有效端点;修复提示词缓存问题后,这些洞见还使 eve 的总成本降低了 ~15%。
- 测试表明,99% 的网站尚未为 AI 智能体做好准备。
由于测试框架的预期与实际网站不匹配,智能体在真实站点上经常失败,这表明大多数网站缺乏可靠的智能体驱动注册、集成和支付所需的基础设施。
- Ora 的工程团队利用与 Vercel 集成的编码智能体,每天进行数百次提交。
借助整合的技术栈,编码智能体可以处理日志、调试、部署和环境变量变更,每周为工程师节省数小时,并提高生产力。
Ora 如何在 Vercel 上对每个主流 AI 智能体进行基准测试 | 客户案例 | Vercel
Ora 在 Vercel 上运行一个基准测试平台,让主流 AI 智能体——Claude Code、ChatGPT、Gemini、Hermes、OpenClaw 以及 Vercel 自家的 eve——在实际客户站点上同台竞技。通过追踪每个测试框架的步骤数、成本、延迟和成功率,Ora 揭示了智能体的失败之处,并表明 99% 的网站尚未为智能体做好准备。该基准测试也反馈给了 eve,发现了一个提示词缓存问题,修复后成本下降了约 15%。
文章金句
"你在 eve 上无需过多配置,它开箱即用,与其他测试框架的一致性令人惊叹。
"按照 Ora 自己的衡量标准,99% 的网站仍然无法应对一个要注册、集成并支付的智能体。
"所有内容都整合到同一套基础设施中,这让我们的编码智能体效率大大提高。我甚至不需要登录 Vercel 的界面。我让编码智能体去查看日志、调试一切、部署代码、修改环境变量。
"我从这项技术刚出现时就开始构建智能体,eve 是我经历过的最简单的上手体验。