Posts for: #Benchmark

通过率只差 17 个点,账单却差 17 倍:9 个 AI 编程助手同台实测

通过率只差 17 个点,账单却差 17 倍:9 个 AI 编程助手同台实测

Runta 团队做了一场罕见的公平评测:把模型、任务、运行环境全部固定,只让 harness(代理执行层)这一个变量变化,让 9 个 AI 编程助手同台跑 360 次任务。结果很反直觉:12 种配置的通过率只差 17 个点,但每次通过的成本从 1.05 美元一路差到 18.34 美元,相差整整 17 倍。Codex 通过率最高且成本贴近中位数,Claude Code 通过率与 DSH Creator 相同却贵了 5.6 倍。文章用一道 python-statemachine 任务当标本,讲清了「会做题」和「会省钱」是两件独立的事。

[阅读更多]