一位开发者梳理了自己与 Codex 打交道的这些年,从 GPT-3 API 时代一路走到后 harness 时代,最后列出一份反主流的清单:博客、私人消息、架构、数据建模这四件事,他坚决不交给 AI。
给 Codex 划边界:我拒绝交给 AI 的四件事


一位开发者梳理了自己与 Codex 打交道的这些年,从 GPT-3 API 时代一路走到后 harness 时代,最后列出一份反主流的清单:博客、私人消息、架构、数据建模这四件事,他坚决不交给 AI。

Simon Willison 公开了一份 Codex 工作会话的完整能力快照,包含 232 个工具接口和 44 个 SKILL.md 技能文件。这篇文章拆解工具与技能的区别,看看一个 AI Agent 的真实能力边界到底是怎么构成的。

说到 AI 编程烧钱,大家首先想到的是 Claude Code,那 Codex 是不是更省钱?作者用真金白银做了测试:一个再普通不过的 CLI 重构 PR,24 小时内烧光 270 美元的溢出额度。拆开账单才发现,真正的开销大头不是模型输出,而是并行子代理和反复读取的缓存,外加一个不小心踩中的 fast mode 溢价。

一年前,编辑器里的代码几乎每一行都是自己敲的;今天,大部分代码是模型已经写好的 diff,你只负责读、判断、保留。真正的瓶颈从写得快不快,挪到了验证得准不准。这篇文章拆解这个位移,并给出结论:当 AI 写代码,验证就是新的实现,而判断力是我们手里最后一块不会被拿走的地盘。

把一个大任务交给编码代理,它没超时也没超预算,却只完成了三分之一就宣布收工。Factory 团队用重建 gdal 的实验拆开了这个现象:代理缺的从来不是能力,而是一份「完成的标准」。动手之前先定义验收,同一个模型的复现率能从 36% 翻到 90%。