你花了一下午写了个 Codex Skill,今天跑得完美,明天模型一更新就崩了。本文介绍 Caliper,一个专门为 AI Agent Skills 设计的可靠性测试框架,用 pass@k 量化你的 Skill 到底有多靠谱。
你的 Codex Skill 真的靠谱吗?用 Caliper 量化 Agent 的可靠性


你花了一下午写了个 Codex Skill,今天跑得完美,明天模型一更新就崩了。本文介绍 Caliper,一个专门为 AI Agent Skills 设计的可靠性测试框架,用 pass@k 量化你的 Skill 到底有多靠谱。

2026 年,AI 编程已经从「让 AI 帮你写几行代码」进化为「设计一套让多个 AI Agent 协同工作的流水线」。本文梳理从 Vibe Coding 到 Agentic Engineering 的演进路径,介绍四大主流项目工作流,以及落地时最关键的三项技术。

上周末,Codex 用户突然发现自己的额度被迅速耗尽。OpenAI 紧急拉起周日「作战室」,查出 AI Agent 在后台「偷偷加班」的真相。这次事件揭开了 AI 编程工具隐性成本的面纱。

OpenAI 为 Codex 推出了安全扫描插件和云端安全服务,将 AI Agent 的能力从「写代码」扩展到了「审代码」。这款工具能自动发现漏洞、验证误报、生成修复建议,让安全审查从人工苦活变成了 AI 驱动的工作流。

如果把 100 条失败记录和一个性能指标交给 AI 编程代理,不提供任何专业工具,它能自己找出问题、修改提示词、提升模型表现吗?Andrew Jesson 的实验给出了令人惊讶的答案。