你花了一下午写了个 Codex Skill,今天跑得完美,明天模型一更新就崩了。本文介绍 Caliper,一个专门为 AI Agent Skills 设计的可靠性测试框架,用 pass@k 量化你的 Skill 到底有多靠谱。
你的 Codex Skill 真的靠谱吗?用 Caliper 量化 Agent 的可靠性


你花了一下午写了个 Codex Skill,今天跑得完美,明天模型一更新就崩了。本文介绍 Caliper,一个专门为 AI Agent Skills 设计的可靠性测试框架,用 pass@k 量化你的 Skill 到底有多靠谱。

2026 年,AI 编程已经从「让 AI 帮你写几行代码」进化为「设计一套让多个 AI Agent 协同工作的流水线」。本文梳理从 Vibe Coding 到 Agentic Engineering 的演进路径,介绍四大主流项目工作流,以及落地时最关键的三项技术。

上周末,Codex 用户突然发现自己的额度被迅速耗尽。OpenAI 紧急拉起周日「作战室」,查出 AI Agent 在后台「偷偷加班」的真相。这次事件揭开了 AI 编程工具隐性成本的面纱。

OpenAI 为 Codex 推出了安全扫描插件和云端安全服务,将 AI Agent 的能力从「写代码」扩展到了「审代码」。这款工具能自动发现漏洞、验证误报、生成修复建议,让安全审查从人工苦活变成了 AI 驱动的工作流。

OpenAI 发布内部研究报告《The Shift to Agentic AI》,用 Codex 的使用数据展示了 AI 从「对话工具」到「生产工具」的质变。用户数暴涨 5 倍,8 小时级任务增长 10 倍,研究员月产出暴增 50 倍。