你花了一下午写了个 Codex Skill,今天跑得完美,明天模型一更新就崩了。本文介绍 Caliper,一个专门为 AI Agent Skills 设计的可靠性测试框架,用 pass@k 量化你的 Skill 到底有多靠谱。
你的 Codex Skill 真的靠谱吗?用 Caliper 量化 Agent 的可靠性


你花了一下午写了个 Codex Skill,今天跑得完美,明天模型一更新就崩了。本文介绍 Caliper,一个专门为 AI Agent Skills 设计的可靠性测试框架,用 pass@k 量化你的 Skill 到底有多靠谱。

OpenAI 官方发布了 Codex 最佳实践指南,涵盖提示词结构、AGENTS.md 配置、计划模式、测试驱动验证、MCP 工具接入、Skills 技能封装和自动化调度七大核心板块。本文完整解读这些实践,并补充真实使用经验中的技巧和坑。

Codex 有三种界面,底层却共用一套配置栈。本文从 AGENTS.md 指令层级、MCP 外部工具接入、Skills 可复用技能,到 config.toml 细粒度调优,完整拆解 Codex 的配置体系,帮你构建一套可维护、可扩展的 AI 编程环境。

深入解析 OpenAI Codex 的四层配置架构:AGENTS.md 指令体系、MCP 服务器扩展、Skills 可复用剧本、config.toml 偏好设置。三个界面共享同一套配置,理解分层逻辑才能真正驾驭 Codex。