有人把 Codex 的请求体逐字节截下来测量,发现一句 16 字符的「Reply with pong.」被包装成了 42980 字节、约 9435 个 token 的请求,真正的提示词只占 0.3%。其余全是工具定义、系统指令、技能元数据和环境上下文。本文拆解这个被多数人忽略的开销,以及它对隐私和成本意味着什么。
你只输入了 16 个字符,Codex 却发走了 4 万字节:拆开一个真实的请求体


有人把 Codex 的请求体逐字节截下来测量,发现一句 16 字符的「Reply with pong.」被包装成了 42980 字节、约 9435 个 token 的请求,真正的提示词只占 0.3%。其余全是工具定义、系统指令、技能元数据和环境上下文。本文拆解这个被多数人忽略的开销,以及它对隐私和成本意味着什么。

一位开发者分析了 390,195 次 Codex 响应记录后发现:GPT-5.5 有 44% 的概率在产生恰好 516 个推理 Token 时停下,这不是巧合,是一个隐藏在模型内部的「推理预算墙」。

AI 编程助手在不知不觉中浪费了大量 Token,从缓存命中率、上下文膨胀到 MCP 工具开销,这些隐性成本正在吞噬你的使用配额。本文分析五大 Token 浪费陷阱,并给出可操作的对策。