Databricks 用真实 PR 构建了一套编程 Agent 基准测试体系,覆盖千万行代码。结果出人意料:开源模型 GLM 5.2 已能匹敌 Opus 4.8,而 Harness 选择对成本的影响比模型本身还大。
编程 Agent 的「体检报告」:Databricks 如何在百万行代码中给 AI 打分


Databricks 用真实 PR 构建了一套编程 Agent 基准测试体系,覆盖千万行代码。结果出人意料:开源模型 GLM 5.2 已能匹敌 Opus 4.8,而 Harness 选择对成本的影响比模型本身还大。

OpenAI 正式将 Codex 并入 ChatGPT 桌面应用,同时发布 ChatGPT Work 和 Sites。这对 Codex 用户意味着什么?从独立 CLI 到超级平台,本文深度分析这次合并背后的战略逻辑。

GPT-5.6 为 Codex 带来了 Sol / Terra / Luna 三层模型架构,以及核心的 Plan-Act-Verify 自主编程循环。本文拆解这套体系的设计逻辑、实战代码和成本控制策略。

AI 编程助手在不知不觉中浪费了大量 Token,从缓存命中率、上下文膨胀到 MCP 工具开销,这些隐性成本正在吞噬你的使用配额。本文分析五大 Token 浪费陷阱,并给出可操作的对策。

OpenAI Codex 推出 Record & Replay 功能,AI 通过观察用户的一次操作就能学会并自动重复复杂工作流。从 YouTube 上传到企业自动化,Record & Replay 代表了一种新的交互范式:不再写脚本,不再写 prompt,演示一次就够了。