通过率只差 17 个点,账单却差 17 倍:9 个 AI 编程助手同台实测

想象一下,你和同事用同一个底层模型、解同一道 bug,任务难度一模一样。一个月后,你俩的账单却差了十几倍。
这不是夸张,而是 Runta 团队在 FrontierHarness 评测里真实验证出来的结论。
过去我们聊 AI 编程助手,注意力几乎全放在「模型」上:哪个模型的 benchmark 分数高、通过率高、代码写得好。但这次评测戳破了一个被长期忽略的事实:在模型能力之上,还隔着一层代理执行层(harness),而正是这一层,决定了你的钱有多少真正花在了解题上,又有多少被白白烧掉了。
模型负责「会不会」,harness 负责「花多少」#
Runta 是一家做 agent 执行层的公司,他们最关心的问题是:一个 agent 完成一件它本来就会做的任务,到底要烧多少算力?这其中有几分是模型决定的,有几分是 harness 决定的?
模型评测回答的是「能力上限」:这个模型会不会做这道题。但 harness 负责提供工具和运行环境,它决定了这份能力有多少被用来解题,又有多少浪费在来回试错、无效的工具调用、以及没有命中的缓存上。
于是他们做了 FrontierHarness v1.0。核心思路只有一句话:把模型、任务、运行环境全部固定,只让 harness 这一个变量变化,看看账单会差多少。
一场公平的对决:怎么排除「主场优势」#
要公平比较不同的 harness,最怕的就是主场优势:用 Claude 模型测,天然偏向 Claude Code;用 GPT 模型测,天然偏向 Codex。
所以他们选了一个中立模型:Kimi K3。这是一个前沿水平的编程模型,有公开的 token 定价和隐式前缀缓存,通过 Fireworks 这个第三方推理后端统一提供。所有 9 个 harness 都连到同一个网关,网关同时支持 OpenAI Responses API 和 Anthropic Messages API,让每个 harness 用自己的原生协议去访问同一份模型权重。
评测规模也很扎实:30 个任务(21 个 Terminal-Bench、9 个 DeepSWE),9 个 harness,12 种配置,一共 360 次评测,每个任务和配置组合都有一次正式结果。
更关键的是「冷启动」:每一次评测都从同一个 golden checkpoint 全新恢复,vCPU、内存、磁盘内容、内存状态完全一致。任何一次试跑都不会污染下一次,因为隐式前缀缓存会让调试过的轨迹「热」上好几个小时。每个格子只有一次机会,不允许重试,因为重试天然就是更热的,会人为抬高分数。
核心结果:通过率很接近,账单差 17 倍#
先说总体。360 次评测里,209 次成功、151 次失败,全场通过率 58.1%。
最反直觉的地方在这里:12 种配置的通过率非常接近,从 50.0% 到 66.7%,只差 17 个点。但「每次通过任务的中位数成本」,从 1.05 美元一路到 18.34 美元,差了整整 17 倍。
换句话说,两个 harness 可以解出同一道题,但一个的花费可能是另一个的十倍以上。
| Harness | 每次通过成本 | 通过率 | 缓存命中 | 中位耗时 |
|---|---|---|---|---|
| Codex | $3.47 | 66.7% | 88.0% | 6m 43s |
| DSH Creator | $3.28 | 63.3% | 84.3% | 6m 44s |
| Claude Code | $18.34 | 63.3% | 67.8% | 9m 38s |
| Pi | $2.43 | 60.0% | 79.4% | 7m 33s |
| DSH Standard | $3.46 | 60.0% | 86.5% | 6m 17s |
| DSH PTC | $4.58 | 60.0% | 87.2% | 7m 44s |
| Kimi Code | $3.65 | 56.7% | 88.0% | 7m 56s |
| DSH Minimal | $4.72 | 56.7% | 84.6% | 5m 41s |
| Oh My Pi | $4.75 | 56.7% | 82.2% | 6m 46s |
| Exo Harness | $1.05 | 53.3% | 70.3% | 6m 17s |
| Hermes | $2.90 | 50.0% | 85.9% | 6m 58s |
| OpenCode | $3.24 | 50.0% | 78.4% | 6m 27s |
几个位置值得单独拎出来看:
- Codex 是「质量领先者」:通过率最高(66.7%),而每次通过的成本 3.47 美元恰好落在全场中位数附近。效率和质量并不互斥。
- Claude Code 是另一极:通过率 63.3%,和 DSH Creator 一模一样,但每次通过要 18.34 美元,是后者的 5.6 倍。
- Exo Harness 和 Pi 用别人几分之一的钱就能解出任务:Exo 每次通过只要 1.05 美元,Pi 只要 2.43 美元。
三个反直觉的发现#
评测报告里提炼出的三个模式,比排行榜本身更有意思。
第一,会做题和会省钱,是两件独立的事。 Claude Code 和 DSH Creator 都通过了 19 道题,成绩完全相同。但一个每次通过花 3.28 美元,另一个花 18.34 美元。同样的成功率,账单差了 5.6 倍。
第二,缓存命中率不等于省钱。 一个缓存命中率很高、却折腾了 300 轮的失败任务,可能比一个缓存几乎没命中、但很短的快速成功任务烧掉更多钱。你真正付费的是步骤数和 token 量,缓存只是改变了单价,没有改变总量。
第三,同门出身并没有带来优势。 Kimi Code 和评测用的 Kimi K3 来自同一家 lab,照理说应该有原生路径的优势,但它只排第七(通过率 56.7%),成本也位居中游。它的缓存命中率高达 88.0%,并列全场第一,但这个高命中率既没有转化成更高的通过率,也没有转化成更低的成本。
Claude Code 为什么那么贵?一场缓存之谜#
排行榜上最刺眼的数字,是 Claude Code 的 18.34 美元。要理解它,得先分清两个「缓存命中率」。
排行榜展示的是「中位数缓存命中率」:Claude Code 是 67.8%,比 Codex 的 88.0% 低 1.3 倍,看起来还不算太离谱。但真正决定总 token 账单的,是「按 token 加权的命中率」,这个数字 Claude Code 只有 25.0%,而其他 harness 都在 91.6% 到 99.1% 之间。中位数和加权值之间差了 2.7 倍。
为什么会这样?因为加权命中率被一个异常昂贵的任务严重拉低了。那个任务是 python-statemachine-state-data-scoping,Claude Code 在它身上烧了 2460 万输入 token,缓存命中率只有 15.7%,单题花费 64.36 美元,占了它总 token 用量的 68%。换句话说,25.0% 这个加权数字,主要是这一个格子造成的,并不代表 Claude Code 的典型表现。
报告对此的解释很克制:这很可能是「harness 和模型的匹配问题」。Claude Code 是围绕 Anthropic 模型的显式缓存控制语义设计的,而 K3 提供的是行为不同的隐式前缀缓存,同样的缓存策略迁移过去就不那么顺。在一份存档会话里,同一个只增不改的对话前缀,有的调用命中 100%,有的调用完全没命中,这种忽高忽低正是隐式缓存的特征,而不是一个稳定的缓存策略。
所以 18.34 美元和 64.36 美元描述的是「被测试的那套完整配置」,而不是 Claude Code 单独的表现。报告把「分离 harness 和模型各自的贡献」列为 v1.1 的头号任务,态度相当严谨。
一道题,看穿全部本质#
如果只挑一个任务来看透这场评测,python-statemachine-state-data-scoping 是最好的标本。
这是一道针对 python-statemachine 库的功能请求,要同时改动元类、回调注入机制、历史恢复、序列化、SCXML 解析器和图表渲染器,还要保证现有测试全绿。官方 DeepSWE 通过率只有 38%,历史上中位数要跑 117 步。
12 个配置里有 7 个通过了这道题,但它们的「收据」完全不同:
| Harness | 结果 | 成本 | 轮数 | 缓存命中 | 耗时 |
|---|---|---|---|---|---|
| Pi | 通过 | $2.50 | 90 | 98.2% | 39m |
| Codex | 通过 | $5.97 | 187 | 99.1% | 37m |
| Hermes | 通过 | $6.70 | 156 | 99.1% | 29m |
| Kimi Code | 通过 | $9.24 | 209 | 99.3% | 38m |
| DSH Standard | 通过 | $10.14 | 227 | 99.3% | 47m |
| DSH Minimal | 通过 | $10.49 | 259 | 99.1% | 44m |
| Claude Code | 通过 | $64.36 | 381 | 15.7% | 60m |
| Exo Harness | 失败 | $1.46 | 51(触顶) | 96.0% | 40m |
| Oh My Pi | 失败 | $2.71 | 86 | 98.3% | 42m |
| DSH Creator | 失败(超时) | $3.88 | 109 | 98.8% | 60m |
| DSH PTC | 失败(超时) | $12.95 | 285 | 99.5% | 60m |
| OpenCode | 失败(超时) | n/a | 0 | n/a | 60m |
这道题就是整份报告的缩影:七套配置拿到了同样的结果(验证器通过),但代价天差地别。Pi 和 Claude Code 都通过了,价格却差了 26 倍。Pi 用 90 轮就修好了,Claude Code 用了 381 轮,缓存命中率是 15.7% 对 98.2%。轮数更多,每一轮还更贵。而「通过/失败」这个二进制结果,完全看不到这两层差异。
还有一个耐人寻味的细节:DSH PTC 在一次失败的任务上花了 12.95 美元,比七套通过配置里的六套都贵。DSH Creator 花了 3.88 美元失败,而同一个 harness、同一个模型、同一个运行环境的 DSH Minimal 却用 10.49 美元通过了。区别只是不同的预设(preset)。Creator 触到了 60 分钟上限,说明提示词和工具配置会同时影响节奏和结果。
那到底该怎么选?#
报告给出的结论很实用:
- Codex 是稳妥的默认选项。 通过率最高,成本又贴近中位数,没有明显的短板。
- Pi 适合「同一个任务要反复跑很多次」的场景。 单次成本低,token 花费会随着重复运行不断复利。
- Exo 是「最便宜的失败」。 它每次完成只要 1.05 美元,部分原因是它会及时止损:在最难的任务上,它触到 51 步上限就停下来,用 1.46 美元换来一次失败,而别人还在继续烧钱。评测没有测重试,但一个「便宜地失败」的 harness,恰恰是你最愿意去重试的那种。
- DSH 证明了「配置」本身就是个大变量。 同一个模型、同一个运行环境,四种预设的通过率差了 6.6 个点,成本差了 1.4 倍,这个差距已经和很多 harness 之间的差距相当了。
我的看法#
这份评测最值得记住的,不是「Codex 第一」这个名次,而是它把问题问对了:当大家还在为 benchmark 上的几个百分点较劲时,真正的成本差异藏在一个更容易被忽略的地方。
对普通开发者来说,有三点可以直接拿走。
第一,选工具别只看通过率。如果两个工具通过率差不多,但一个每次通过的成本是另一个的五倍,长期跑下来就是一笔真金白银的差距,尤其是把 agent 挂进 CI、每天跑几十上百次的时候。
第二,缓存命中率会骗人。厂商都喜欢宣传高缓存命中,但这个数字要看「加权」版本,还要看它到底有没有转化成更少的步骤和更低的账单。Kimi Code 命中率全场第一,成本却只排中游,就是最好的反例。
第三,「失败得便宜」是一种被低估的能力。一个触到步数上限就及时停手的 agent,可能比一个为了极小的成功概率死磕到底、烧掉十倍预算的 agent,更适合放在自动化流水线里。
当然,这份评测也有边界。它只覆盖了软件开发和终端类任务,还没有触及更广的 agentic 或知识类工作;它原样使用了每个 harness,没有为了公平去「优化」那些对缓存有强主张的工具,所以报告也坦诚无法剥离「模型」和「harness」各自的贡献。这些恰好是 v1.1 要去补的课:不再固定模型,改成完整的 harness 与模型矩阵,看看「谁配谁」最划算。
但 v1.0 已经说清了一件事:在 AI 编程这件事上,模型能力只是入场券,harness 的工程设计,才是决定你月底账单的那只手。