Databricks 用真实 PR 构建了一套编程 Agent 基准测试体系,覆盖千万行代码。结果出人意料:开源模型 GLM 5.2 已能匹敌 Opus 4.8,而 Harness 选择对成本的影响比模型本身还大。
编程 Agent 的「体检报告」:Databricks 如何在百万行代码中给 AI 打分


Databricks 用真实 PR 构建了一套编程 Agent 基准测试体系,覆盖千万行代码。结果出人意料:开源模型 GLM 5.2 已能匹敌 Opus 4.8,而 Harness 选择对成本的影响比模型本身还大。

OpenAI 正式将 Codex 并入 ChatGPT 桌面应用,同时发布 ChatGPT Work 和 Sites。这对 Codex 用户意味着什么?从独立 CLI 到超级平台,本文深度分析这次合并背后的战略逻辑。

在 GraphQL-go-tools 的 26 个真实 PR 上跑完 GPT-5.5 Codex 四种推理强度后,数据告诉我们:测试通过率会骗人,high 是性价比甜点,xhigh 是质量模式。

让 AI 审查 AI 写的代码,听起来很美,实际做起来问题一大堆。审查循环往往不会收敛,每一轮都在加补丁、加文字、加伪代码。Convergo 这个开源插件用「新鲜审查者」和「摄入优先」两条核心规则,把发散的螺旋扭成了收敛的环。

大多数 AI 助手在它们最不了解的时候反而最自信。Aletheia 反其道而行之,用一个「信念→行动→观察→更新」的循环,让 AI 学会区分真正的知道和假装知道。