想象一下,你和同事用同一个底层模型、解同一道 bug,任务难度一模一样。一个月后,你俩的账单却差了十几倍。

这不是夸张,而是 Runta 团队在 FrontierHarness 评测里真实验证出来的结论。

过去我们聊 AI 编程助手,注意力几乎全放在「模型」上:哪个模型的 benchmark 分数高、通过率高、代码写得好。但这次评测戳破了一个被长期忽略的事实:在模型能力之上,还隔着一层代理执行层(harness),而正是这一层,决定了你的钱有多少真正花在了解题上,又有多少被白白烧掉了。

模型负责「会不会」,harness 负责「花多少」#

Runta 是一家做 agent 执行层的公司,他们最关心的问题是:一个 agent 完成一件它本来就会做的任务,到底要烧多少算力?这其中有几分是模型决定的,有几分是 harness 决定的?

模型评测回答的是「能力上限」:这个模型会不会做这道题。但 harness 负责提供工具和运行环境,它决定了这份能力有多少被用来解题,又有多少浪费在来回试错、无效的工具调用、以及没有命中的缓存上。

于是他们做了 FrontierHarness v1.0。核心思路只有一句话:把模型、任务、运行环境全部固定,只让 harness 这一个变量变化,看看账单会差多少。

一场公平的对决:怎么排除「主场优势」#

要公平比较不同的 harness,最怕的就是主场优势:用 Claude 模型测,天然偏向 Claude Code;用 GPT 模型测,天然偏向 Codex。

所以他们选了一个中立模型:Kimi K3。这是一个前沿水平的编程模型,有公开的 token 定价和隐式前缀缓存,通过 Fireworks 这个第三方推理后端统一提供。所有 9 个 harness 都连到同一个网关,网关同时支持 OpenAI Responses API 和 Anthropic Messages API,让每个 harness 用自己的原生协议去访问同一份模型权重。

评测规模也很扎实:30 个任务(21 个 Terminal-Bench、9 个 DeepSWE),9 个 harness,12 种配置,一共 360 次评测,每个任务和配置组合都有一次正式结果。

更关键的是「冷启动」:每一次评测都从同一个 golden checkpoint 全新恢复,vCPU、内存、磁盘内容、内存状态完全一致。任何一次试跑都不会污染下一次,因为隐式前缀缓存会让调试过的轨迹「热」上好几个小时。每个格子只有一次机会,不允许重试,因为重试天然就是更热的,会人为抬高分数。

核心结果:通过率很接近,账单差 17 倍#

先说总体。360 次评测里,209 次成功、151 次失败,全场通过率 58.1%。

最反直觉的地方在这里:12 种配置的通过率非常接近,从 50.0% 到 66.7%,只差 17 个点。但「每次通过任务的中位数成本」,从 1.05 美元一路到 18.34 美元,差了整整 17 倍。

换句话说,两个 harness 可以解出同一道题,但一个的花费可能是另一个的十倍以上。

Harness每次通过成本通过率缓存命中中位耗时
Codex$3.4766.7%88.0%6m 43s
DSH Creator$3.2863.3%84.3%6m 44s
Claude Code$18.3463.3%67.8%9m 38s
Pi$2.4360.0%79.4%7m 33s
DSH Standard$3.4660.0%86.5%6m 17s
DSH PTC$4.5860.0%87.2%7m 44s
Kimi Code$3.6556.7%88.0%7m 56s
DSH Minimal$4.7256.7%84.6%5m 41s
Oh My Pi$4.7556.7%82.2%6m 46s
Exo Harness$1.0553.3%70.3%6m 17s
Hermes$2.9050.0%85.9%6m 58s
OpenCode$3.2450.0%78.4%6m 27s

几个位置值得单独拎出来看:

  • Codex 是「质量领先者」:通过率最高(66.7%),而每次通过的成本 3.47 美元恰好落在全场中位数附近。效率和质量并不互斥。
  • Claude Code 是另一极:通过率 63.3%,和 DSH Creator 一模一样,但每次通过要 18.34 美元,是后者的 5.6 倍。
  • Exo Harness 和 Pi 用别人几分之一的钱就能解出任务:Exo 每次通过只要 1.05 美元,Pi 只要 2.43 美元。

三个反直觉的发现#

评测报告里提炼出的三个模式,比排行榜本身更有意思。

第一,会做题和会省钱,是两件独立的事。 Claude Code 和 DSH Creator 都通过了 19 道题,成绩完全相同。但一个每次通过花 3.28 美元,另一个花 18.34 美元。同样的成功率,账单差了 5.6 倍。

第二,缓存命中率不等于省钱。 一个缓存命中率很高、却折腾了 300 轮的失败任务,可能比一个缓存几乎没命中、但很短的快速成功任务烧掉更多钱。你真正付费的是步骤数和 token 量,缓存只是改变了单价,没有改变总量。

第三,同门出身并没有带来优势。 Kimi Code 和评测用的 Kimi K3 来自同一家 lab,照理说应该有原生路径的优势,但它只排第七(通过率 56.7%),成本也位居中游。它的缓存命中率高达 88.0%,并列全场第一,但这个高命中率既没有转化成更高的通过率,也没有转化成更低的成本。

Claude Code 为什么那么贵?一场缓存之谜#

排行榜上最刺眼的数字,是 Claude Code 的 18.34 美元。要理解它,得先分清两个「缓存命中率」。

排行榜展示的是「中位数缓存命中率」:Claude Code 是 67.8%,比 Codex 的 88.0% 低 1.3 倍,看起来还不算太离谱。但真正决定总 token 账单的,是「按 token 加权的命中率」,这个数字 Claude Code 只有 25.0%,而其他 harness 都在 91.6% 到 99.1% 之间。中位数和加权值之间差了 2.7 倍。

为什么会这样?因为加权命中率被一个异常昂贵的任务严重拉低了。那个任务是 python-statemachine-state-data-scoping,Claude Code 在它身上烧了 2460 万输入 token,缓存命中率只有 15.7%,单题花费 64.36 美元,占了它总 token 用量的 68%。换句话说,25.0% 这个加权数字,主要是这一个格子造成的,并不代表 Claude Code 的典型表现。

报告对此的解释很克制:这很可能是「harness 和模型的匹配问题」。Claude Code 是围绕 Anthropic 模型的显式缓存控制语义设计的,而 K3 提供的是行为不同的隐式前缀缓存,同样的缓存策略迁移过去就不那么顺。在一份存档会话里,同一个只增不改的对话前缀,有的调用命中 100%,有的调用完全没命中,这种忽高忽低正是隐式缓存的特征,而不是一个稳定的缓存策略。

所以 18.34 美元和 64.36 美元描述的是「被测试的那套完整配置」,而不是 Claude Code 单独的表现。报告把「分离 harness 和模型各自的贡献」列为 v1.1 的头号任务,态度相当严谨。

一道题,看穿全部本质#

如果只挑一个任务来看透这场评测,python-statemachine-state-data-scoping 是最好的标本。

这是一道针对 python-statemachine 库的功能请求,要同时改动元类、回调注入机制、历史恢复、序列化、SCXML 解析器和图表渲染器,还要保证现有测试全绿。官方 DeepSWE 通过率只有 38%,历史上中位数要跑 117 步。

12 个配置里有 7 个通过了这道题,但它们的「收据」完全不同:

Harness结果成本轮数缓存命中耗时
Pi通过$2.509098.2%39m
Codex通过$5.9718799.1%37m
Hermes通过$6.7015699.1%29m
Kimi Code通过$9.2420999.3%38m
DSH Standard通过$10.1422799.3%47m
DSH Minimal通过$10.4925999.1%44m
Claude Code通过$64.3638115.7%60m
Exo Harness失败$1.4651(触顶)96.0%40m
Oh My Pi失败$2.718698.3%42m
DSH Creator失败(超时)$3.8810998.8%60m
DSH PTC失败(超时)$12.9528599.5%60m
OpenCode失败(超时)n/a0n/a60m

这道题就是整份报告的缩影:七套配置拿到了同样的结果(验证器通过),但代价天差地别。Pi 和 Claude Code 都通过了,价格却差了 26 倍。Pi 用 90 轮就修好了,Claude Code 用了 381 轮,缓存命中率是 15.7% 对 98.2%。轮数更多,每一轮还更贵。而「通过/失败」这个二进制结果,完全看不到这两层差异。

还有一个耐人寻味的细节:DSH PTC 在一次失败的任务上花了 12.95 美元,比七套通过配置里的六套都贵。DSH Creator 花了 3.88 美元失败,而同一个 harness、同一个模型、同一个运行环境的 DSH Minimal 却用 10.49 美元通过了。区别只是不同的预设(preset)。Creator 触到了 60 分钟上限,说明提示词和工具配置会同时影响节奏和结果。

那到底该怎么选?#

报告给出的结论很实用:

  • Codex 是稳妥的默认选项。 通过率最高,成本又贴近中位数,没有明显的短板。
  • Pi 适合「同一个任务要反复跑很多次」的场景。 单次成本低,token 花费会随着重复运行不断复利。
  • Exo 是「最便宜的失败」。 它每次完成只要 1.05 美元,部分原因是它会及时止损:在最难的任务上,它触到 51 步上限就停下来,用 1.46 美元换来一次失败,而别人还在继续烧钱。评测没有测重试,但一个「便宜地失败」的 harness,恰恰是你最愿意去重试的那种。
  • DSH 证明了「配置」本身就是个大变量。 同一个模型、同一个运行环境,四种预设的通过率差了 6.6 个点,成本差了 1.4 倍,这个差距已经和很多 harness 之间的差距相当了。

我的看法#

这份评测最值得记住的,不是「Codex 第一」这个名次,而是它把问题问对了:当大家还在为 benchmark 上的几个百分点较劲时,真正的成本差异藏在一个更容易被忽略的地方。

对普通开发者来说,有三点可以直接拿走。

第一,选工具别只看通过率。如果两个工具通过率差不多,但一个每次通过的成本是另一个的五倍,长期跑下来就是一笔真金白银的差距,尤其是把 agent 挂进 CI、每天跑几十上百次的时候。

第二,缓存命中率会骗人。厂商都喜欢宣传高缓存命中,但这个数字要看「加权」版本,还要看它到底有没有转化成更少的步骤和更低的账单。Kimi Code 命中率全场第一,成本却只排中游,就是最好的反例。

第三,「失败得便宜」是一种被低估的能力。一个触到步数上限就及时停手的 agent,可能比一个为了极小的成功概率死磕到底、烧掉十倍预算的 agent,更适合放在自动化流水线里。

当然,这份评测也有边界。它只覆盖了软件开发和终端类任务,还没有触及更广的 agentic 或知识类工作;它原样使用了每个 harness,没有为了公平去「优化」那些对缓存有强主张的工具,所以报告也坦诚无法剥离「模型」和「harness」各自的贡献。这些恰好是 v1.1 要去补的课:不再固定模型,改成完整的 harness 与模型矩阵,看看「谁配谁」最划算。

但 v1.0 已经说清了一件事:在 AI 编程这件事上,模型能力只是入场券,harness 的工程设计,才是决定你月底账单的那只手。


参考来源:Introducing FrontierHarness Eval — Runta