Armature Research 做了一场覆盖 16893 次会话的大规模实验,观察 Claude Code、Codex 和 Cursor 如何挑选第三方服务。结果发现,Codex 在 94% 的会话里都会联网搜索,而且特别偏爱 site: 语法,三个 Agent 却只有 42% 的概率达成一致。
1.7 万次实测:Codex 到底是怎么挑选第三方工具的?


Armature Research 做了一场覆盖 16893 次会话的大规模实验,观察 Claude Code、Codex 和 Cursor 如何挑选第三方服务。结果发现,Codex 在 94% 的会话里都会联网搜索,而且特别偏爱 site: 语法,三个 Agent 却只有 42% 的概率达成一致。

一位开发者梳理了自己与 Codex 打交道的这些年,从 GPT-3 API 时代一路走到后 harness 时代,最后列出一份反主流的清单:博客、私人消息、架构、数据建模这四件事,他坚决不交给 AI。

Simon Willison 公开了一份 Codex 工作会话的完整能力快照,包含 232 个工具接口和 44 个 SKILL.md 技能文件。这篇文章拆解工具与技能的区别,看看一个 AI Agent 的真实能力边界到底是怎么构成的。

说到 AI 编程烧钱,大家首先想到的是 Claude Code,那 Codex 是不是更省钱?作者用真金白银做了测试:一个再普通不过的 CLI 重构 PR,24 小时内烧光 270 美元的溢出额度。拆开账单才发现,真正的开销大头不是模型输出,而是并行子代理和反复读取的缓存,外加一个不小心踩中的 fast mode 溢价。

一年前,编辑器里的代码几乎每一行都是自己敲的;今天,大部分代码是模型已经写好的 diff,你只负责读、判断、保留。真正的瓶颈从写得快不快,挪到了验证得准不准。这篇文章拆解这个位移,并给出结论:当 AI 写代码,验证就是新的实现,而判断力是我们手里最后一块不会被拿走的地盘。