说起 AI 编程的账单,网上流传的那些「烧钱」故事,主角几乎都是 Claude Code。那 OpenAI Codex 呢?它是不是更「安全」、更省钱?我没有答案,也不想再听传言,于是决定真的掏钱做一次实验。

一个再普通不过的 PR,24 小时烧光 270 美元#

在 Quesma,我们开了一个 OpenAI Business 的 ChatGPT & Codex 套餐,每个座位每月 25 美元。套餐自带一部分用量额度,我们又额外允许 270 美元的溢出。结果,一个再普通不过的 PR,在 24 小时之内就把这 270 美元全部用光,连当周的额度都被打爆了。

这个 PR 的内容并不复杂,只是把一个 CLI 应用的鉴权逻辑,从各家云厂商的专属凭证,改写成预签名 URL。它不是什么史诗级重构,就是日常开发里最常见的那一类改动。恰恰是这种「普通」,才让这笔账单显得格外刺眼。

账单拆解:钱到底花在了哪#

按官方列表价折算,这一个 PR 一共烧掉了 283.44 美元的 token。拆开看,构成让人有点意外:

  • 子代理(GPT-5.6 Sol-fast):129.56 美元,占了大头
  • 缓存读取:117.36 美元
  • 输出:36.52 美元
  • 未缓存的输入:20.91 美元

这里有一个反直觉的地方。很多人以为 AI 编程的成本主要花在「生成」上,也就是模型的输出。可真实账单里,输出只占了零头,真正的开销大头是「子代理」和「缓存读取」。

子代理为什么这么贵?因为 Codex 会并行拉起多个子代理,最多一次 7 个,它们各自都要反复读取不断膨胀的对话上下文。对话越长,每一次调用要重新读进去的 token 就越多,成本像滚雪球一样涨。

缓存读取的账单同样有意思。在高峰期,每次调用都要重新读一遍十几万 token 的历史对话,按每百万 token 一美元计算,光这一项,十五分钟就能烧掉十几美元。

还有个更扎心的数字:如果按「朴素估算」,这个 PR 的成本看起来只有 0.64 美元。0.64 和 283,中间差了四百多倍。差距的来源,正是并行子代理和反复读取的大上下文,而这两件事在朴素估算里根本看不见。

自动压缩在帮你省钱,fast mode 在偷偷加钱#

好消息是,Codex 默认设置下的「自动压缩」做得不错。它会把 21 万 token 的上下文压缩到两三万,避开了长上下文的缓存失效问题,这一点比 Claude Code 的表现要稳。而且 Codex 的缓存不额外收费,整体 token 成本更低。

坏消息是,fast mode 太容易误触了。我在实验里不小心确认了 fast mode,结果整个改动的前半段,都以两倍的费率在跑。上面那 283 美元里,有 110 美元是 fast mode 带来的溢价,这笔钱花得毫无价值。

更麻烦的是,OpenAI 不允许在整个 Business 组织层面关闭 fast mode;而 Claude 那边恰恰相反,想开 fast mode 需要组织管理员审批才能启用。一边默认容易踩坑,一边默认保守,两者的体验截然不同。

座位订阅 vs 按量计费:差了一个数量级#

这 283 美元的一天,居然能塞进一个 200 美元一个月的订阅里,还绰绰有余。我在 Claude Code Max 20x 上,几乎每个工作日都提交类似的 PR;同事们也在 ChatGPT Pro 20x 上做着同样的事。

这和 SemiAnalysis 的测算对得上:OpenAI 的 200 美元套餐,实际能提供高达每月 14000 美元的 token 价值。换算下来,座位订阅比按 token 付费便宜了大约 70 倍,而 Claude 那边是 40 倍。方向一致,只是 OpenAI 的补贴力度更大。

定价背后,藏着两家的渊源#

定价这件事,其实埋着 OpenAI 与 Anthropic 的一段旧账。

OpenAI 是最早把「能写代码」做成产品的公司。2021 年 8 月,Codex 模型就上线了。当时一些早期员工想全力押注这个方向,因为理念冲突而离开,创办了 Anthropic,赌的就是「通往 AGI 的路在智能体编程」这条路线。

于是这些年,Anthropic 专注企业端和编程,而 OpenAI 广撒网做研究,最终 ChatGPT 成了最大的赢家。Codex 作为先行者,早期按「条消息」计费,后来才改成按 token,再到现在,因为聊天产生的 token 数趋于稳定,才转向座位订阅。

真正的转折点是 2025 年 5 月,Claude Code 和 Claude Opus 4 让 Anthropic 加速狂奔,带来了认可,也带来了争议,两起针对定价的集体诉讼就是例证。OpenAI 被迫重新评估优先级、跟进对标。2026 年 8 月 25 日,随着 ChatGPT Business 的 Premium 座位(每月 125 美元)发布,它终于补齐了对应的产品线。

现在把两家的定价档位放在一起看,几乎是逐条对应的:

档位OpenAI (Codex)Anthropic (Claude Code)
入门ChatGPT Go($8)、Plus($20)Claude Pro($20)
个人进阶ChatGPT Pro 5x / 20x($100 / $200)Claude Max 5x / 20x($100 / $200)
团队标准Business,$25/座位Team,$25/座位
团队进阶Business Premium,$125/座位Team Premium,$125/座位
企业自定义座位价 + 共享额度池$20/座位 + 按 API 用量

最大的区别在入门档。OpenAI 靠庞大的 ChatGPT 用户基数,入门套餐按周限流而不是按小时,你能先痛快地用上几个小时智能体编程,然后要么等一周,要么乖乖升级。

给企业的几条省钱建议#

结合这次实验和我之前的经验,给企业三条实在的建议:

  1. 培训和探索阶段,直接报销个人编程套餐,这是最划算的。现在掌握智能体编程最好的方式就是多用,把它当成限时福利,充分利用这笔巨额补贴。

  2. 尽量长期留在 Team 档。可以用多个套餐、多个供应商来拖延升级的时间。

  3. 不到万不得已不要升 Enterprise。一旦升了,务必先把成本监控和管控配好,否则账单会像脱缰的野马。

结语#

这次实验给我的最大触动,不是「Codex 比 Claude 贵还是便宜」,而是两家的账单模型正在快速趋同,真正的分水岭已经不在「能写多少代码」,而在「你愿不愿意为它买单的方式」。

AI 编程的成本已经彻底透明化了,每一分钱都能追溯到某个子代理、某次缓存读取、某个误触的 fast mode。当账单能被拆到这种颗粒度,省钱就不再是玄学,而是一门可以复盘的工程。


参考来源: