ARTICLE · 人工智能

设计抗 AI 的技术评估

作者:Anthropic Engineering 来源:Anthropic Engineering 2026-08-22 03:42 11 分钟 2661 字
AI 评估技术招聘LLM 能力性能工程抗 AI 设计
一语总结

Anthropic 性能工程负责人详解其招聘笔试题的三次迭代如何被一代代 Claude 模型逐一攻克,揭示怎样的技术评估才能对 AI 辅助保持稳健,并公开发布原始挑战,让人类去击败 Opus 4.5。

AI 总结

Anthropic 性能优化团队负责人 Tristan Hume 讲述了他们用于招聘性能工程师的带回家测试的演变过程。最初的测试——在带有暂存内存、VLIW、SIMD 和多核的模拟加速器上优化代码——从约 1000 名候选人中成功招聘了数十名工程师。然而,每一代新 Claude 模型都逐步攻克了该测试:Opus 4 在 4 小时内超越了大多数人类;Opus 4.5 在 2 小时内达到了人类最佳表现。Hume 经过三次重新设计,发现真实感会让 AI 受益(因为模型拥有关于常见模式的训练数据),而新颖性和受限指令集(灵感来自 Zachtronics 游戏)则更有利于人类推理。当前的测试使用怪异且高度受限的谜题,其中构建调试工具本身就是评估的一部分。Anthropic 将原始的带回家测试作为开放挑战发布:拥有无限时间的人类仍能超过 Claude 的最佳分数(最佳人类成绩约 1487 个周期,而 Claude 最佳为 1363 个周期)。这篇文章提供了关于 AI 在真实工程任务上能力提升的罕见量化洞察,以及设计抗 AI 评估的实用经验。

核心要点
  1. AI 模型通过利用常见模式的训练数据,迅速让贴近现实的技术评估失效。

    每一代 Claude(Opus 4、Opus 4.5)都在时限内比人类更快、更好地解出带回家测试,因为模拟加速器和真实 TPU 相似——这让模型拥有大量可借鉴的训练数据。

  2. 新颖性和受限指令集将优势重新拉回人类推理。

    成功的重新设计采用 Zachtronics 风格的谜题,使用极小且不寻常的指令集(10 条指令、1-2 个寄存器),这些对模型来说属于分布外数据,迫使候选人从第一性原理出发推理,而不是回忆模式。

  3. 时间跨度仍是人类优势;不限时的人类解法依然胜过模型。

    METR 的研究和 Anthropic 的数据显示,人类在超过数小时的任务上仍保有优势。开放挑战发布了原始测试且不限时间——人类最佳成绩(1487 个周期)仍超过 Opus 4.5 的最佳成绩(在 11.5 小时测试后达到的 1363 个周期)。

  4. 设计抗 AI 评估需要以牺牲真实感换取新颖性。

    Hume 承认新测试对日常工作的代表性有所下降,但他认为真实感是种奢侈品:‘原始测试有效是因为它像真实工作;替代方案有效是因为它模拟新颖工作。’

  5. 明确允许 AI 的评估比禁止更能反映岗位现实。

    Anthropic 允许候选人在带回家测试中使用 AI(依据其候选人指引),因为工程师日常会使用 AI。目标是区分在 AI 辅助下的人类贡献,而不是假装 AI 不存在。

设计抗 AI 的技术评估

Anthropic 性能优化团队负责人 Tristan Hume 讲述了他们用于招聘性能工程师的带回家测试的演变过程。最初的测试——在带有暂存内存、VLIW、SIMD 和多核的模拟加速器上优化代码——从约 1000 名候选人中成功招聘了数十名工程师。然而,每一代新 Claude 模型都逐步攻克了该测试:Opus 4 在 4 小时内超越了大多数人类;Opus 4.5 在 2 小时内达到了人类最佳表现。Hume 经过三次重新设计,发现真实感会让 AI 受益(因为模型拥有关于常见模式的训练数据),而新颖性和受限指令集(灵感来自 Zachtronics 游戏)则更有利于人类推理。当前的测试使用怪异且高度受限的谜题,其中构建调试工具本身就是评估的一部分。Anthropic 将原始的带回家测试作为开放挑战发布:拥有无限时间的人类仍能超过 Claude 的最佳分数(最佳人类成绩约 1487 个周期,而 Claude 最佳为 1363 个周期)。这篇文章提供了关于 AI 在真实工程任务上能力提升的罕见量化洞察,以及设计抗 AI 评估的实用经验。

文章金句

"

原始测试有效是因为它像真实工作;替代方案有效是因为它模拟新颖工作。

"

我还不想屈服于‘人类只在超过数小时的任务上才有优势’这种想法。

"

真实感可能是我们再也负担不起的奢侈品。

"

许多平台的工程师都曾受困于数据转置和存储体冲突,因此 Claude 拥有大量可借鉴的训练数据。虽然我是从第一性原理找到解决办法,Claude 却能借助更庞大的经验工具箱。