OpenAI 官方发文拆解 Codex 底层:真正支撑 App、CLI 和 IDE 的是同一个开源 harness。一个关键数据点说明执行循环的价值,GPT-5.6 Sol 在 ARC-AGI-3 上从 13.3% 提升到 38.3%,输出 token 却减少六倍。本文解读这个被多数人忽略的智能体引擎,以及它意味着什么。
Codex 的引擎不在聊天框里:拆解那个可复用的智能体循环


OpenAI 官方发文拆解 Codex 底层:真正支撑 App、CLI 和 IDE 的是同一个开源 harness。一个关键数据点说明执行循环的价值,GPT-5.6 Sol 在 ARC-AGI-3 上从 13.3% 提升到 38.3%,输出 token 却减少六倍。本文解读这个被多数人忽略的智能体引擎,以及它意味着什么。

有人把 Codex 挂到 AWS Bedrock 上跑 GPT-5.6 Sol,账单凭空多出上千美元。追根溯源,85% 的钱花在了 cache-write 上,而根因只是一个刚打开的 web_search 开关。本文复盘这起提示词缓存事故的完整链路,以及它对 agentic 工作流成本管控的启示。

资深 Rails 开发者 Lucian Ghinda 把 Codex 当主力用了一整周,记下十条真实感受:Claude 像会猜你心事的同事,Codex 像克制而精准的工具。本文基于他的观察做原创解读,聊聊两种 AI 编程哲学的本质差异。

Asana 用五句话的 Prompt 加四个并行 Codex agent,把预计还要五年的 Enzyme 前端测试迁移压缩到了两周,总成本约 1.2 万美元。真正的启示不在 AI 有多强,而在代码库这个「脚手架」的质量。

有人对 Codex 做了个实验:跑 9 次 codex exec,退出码全是 0,却有 6 次仓库一个字节都没变。exit code 在 CI 里根本不可信,但 Codex 藏了两个真正可靠的信号:file_change 事件和 stderr 里的 patch rejected。