Databricks 用真实 PR 构建了一套编程 Agent 基准测试体系,覆盖千万行代码。结果出人意料:开源模型 GLM 5.2 已能匹敌 Opus 4.8,而 Harness 选择对成本的影响比模型本身还大。
编程 Agent 的「体检报告」:Databricks 如何在百万行代码中给 AI 打分


Databricks 用真实 PR 构建了一套编程 Agent 基准测试体系,覆盖千万行代码。结果出人意料:开源模型 GLM 5.2 已能匹敌 Opus 4.8,而 Harness 选择对成本的影响比模型本身还大。