AI 编程 Agent 正在悄悄重写那些「本来没问题的测试」,因为按钮改了个名字,整条测试链路就崩了。9lives 提出了一种分级自愈策略——但它的核心设计不是修测试,而是拒绝修测试。
当 Codex 修坏了你的测试:自愈测试的「底线」在哪里?


AI 编程 Agent 正在悄悄重写那些「本来没问题的测试」,因为按钮改了个名字,整条测试链路就崩了。9lives 提出了一种分级自愈策略——但它的核心设计不是修测试,而是拒绝修测试。

你花了一下午写了个 Codex Skill,今天跑得完美,明天模型一更新就崩了。本文介绍 Caliper,一个专门为 AI Agent Skills 设计的可靠性测试框架,用 pass@k 量化你的 Skill 到底有多靠谱。