AI 编程 Agent 正在悄悄重写那些「本来没问题的测试」,因为按钮改了个名字,整条测试链路就崩了。9lives 提出了一种分级自愈策略——但它的核心设计不是修测试,而是拒绝修测试。
当 Codex 修坏了你的测试:自愈测试的「底线」在哪里?


AI 编程 Agent 正在悄悄重写那些「本来没问题的测试」,因为按钮改了个名字,整条测试链路就崩了。9lives 提出了一种分级自愈策略——但它的核心设计不是修测试,而是拒绝修测试。

Codex 在 6 月合并了多智能体通信加密功能,却意外抹掉了子 Agent 任务的可读审计记录。GPT-5.5 用户被强制使用加密路径,开发者正在失去对自己 AI 系统的「视力」。

Databricks 用真实 PR 构建了一套编程 Agent 基准测试体系,覆盖千万行代码。结果出人意料:开源模型 GLM 5.2 已能匹敌 Opus 4.8,而 Harness 选择对成本的影响比模型本身还大。

OpenAI 正式将 Codex 并入 ChatGPT 桌面应用,同时发布 ChatGPT Work 和 Sites。这对 Codex 用户意味着什么?从独立 CLI 到超级平台,本文深度分析这次合并背后的战略逻辑。

在 GraphQL-go-tools 的 26 个真实 PR 上跑完 GPT-5.5 Codex 四种推理强度后,数据告诉我们:测试通过率会骗人,high 是性价比甜点,xhigh 是质量模式。