<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Token 成本 on Codexer</title><link>https://codexer.com/tags/token-%E6%88%90%E6%9C%AC/</link><description>Recent content in Token 成本 on Codexer</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Sat, 19 Sep 2026 08:00:00 +0800</lastBuildDate><atom:link href="https://codexer.com/tags/token-%E6%88%90%E6%9C%AC/index.xml" rel="self" type="application/rss+xml"/><item><title>两个 Agent，一个夜晚，1.58 亿 Token：读了两百本《战争与和平》，只为写出不到一本</title><link>https://codexer.com/posts/2026-09-19-codex-orchestration-cost-idle-parent-trap/</link><pubDate>Sat, 19 Sep 2026 08:00:00 +0800</pubDate><guid>https://codexer.com/posts/2026-09-19-codex-orchestration-cost-idle-parent-trap/</guid><description>&lt;blockquote&gt;
&lt;p&gt;📄 本文综合改写自 Aashish Bhandari（Max）发布在 DEV Community 的实测报告《Two agents, one night, 158 million tokens: what it cost and what we are fixing》，原始数据来自 Codex 会话的运行时分析，原文链接见文末。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;9 月 15 日晚上，一份针对某个 Web 服务的设计评审报告摆到桌面上，里面列了 12 条问题：缺一个事务保护、重试和密钥轮换有缺口、交接路径很脆、诊断信息太薄、可移植性有问题。&lt;/p&gt;
&lt;p&gt;有人把这份清单丢给一个 AI 编程 agent，要求它把这 12 条全部修掉、写好测试、把改动整合起来、打出一个可交付的发布包。它做到了。&lt;/p&gt;
&lt;p&gt;第二天早上，另一个厂商的 AI agent 从零开始重建了同一份结果，做独立复核。两个 agent 用的规则文件不同，厂商不同，会话不同。复核结果：100 个测试全部复现，73 项浏览器检查全部复现，发布包逐字节一致，没有发现严重问题。&lt;/p&gt;
&lt;p&gt;整个夜晚，没有人敲一行代码。&lt;/p&gt;
&lt;h2 id="一张凌晨的成绩单"&gt;一张凌晨的成绩单&lt;/h2&gt;
&lt;p&gt;先把实测数字摆出来，因为这篇复盘最有价值的部分就在这张表里。&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;指标&lt;/th&gt;
 &lt;th style="text-align: right"&gt;实测值&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;墙钟时间，第一条提示到最后一条&lt;/td&gt;
 &lt;td style="text-align: right"&gt;13 小时 4 分&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;其中模型真正在工作的时间，约&lt;/td&gt;
 &lt;td style="text-align: right"&gt;5.5 小时&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;改动文件数 / 新增行数&lt;/td&gt;
 &lt;td style="text-align: right"&gt;118 / 16369&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;第二个 agent 复现的测试&lt;/td&gt;
 &lt;td style="text-align: right"&gt;100 / 100&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;复现的浏览器检查&lt;/td&gt;
 &lt;td style="text-align: right"&gt;73 / 73&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;交付包比对&lt;/td&gt;
 &lt;td style="text-align: right"&gt;逐字节一致&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;所有模型处理的 token 总量&lt;/td&gt;
 &lt;td style="text-align: right"&gt;158137319&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;其中重复读取已缓存上下文&lt;/td&gt;
 &lt;td style="text-align: right"&gt;95.4%&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;其中模型真正新写出的文字&lt;/td&gt;
 &lt;td style="text-align: right"&gt;0.42%&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;负责构建的是一套父子结构：一个最强的模型当父 agent 负责统筹，16 个跑在更便宜模型上的 worker 负责干具体活。按文章作者的说法，模型读掉的内容大约相当于两百本《战争与和平》，而它真正写出来的东西加起来还不到一本。&lt;/p&gt;</description></item></channel></rss>