你用 Codex 写代码的时候,有没有遇到过这种情况:明明选的是 xhigh(最高推理强度),模型也「思考」了,但给出的答案却离谱得不像 GPT-5.5 的水平。更让人困惑的是,同样的问题,有时候答案完全正确,有时候却像换了个模型。

这不是你的幻觉。一位开发者在分析了 390,195 次 Codex 响应记录(覆盖 865 个会话)后,发现了一个惊人的规律:GPT-5.5 有 44% 的概率在产生恰好 516 个推理 Token 时停止思考,而其他模型几乎不存在这种模式。

516 魔咒#

如果你觉得「516」这个数字很眼熟,那不是巧合。在 GitHub 上,一个相关 Issue 的标题直接写道:「gpt-5.5 xhigh sometimes short-circuits with reasoning_output_tokens=516 and wrong final_answer」。更早的时候,CLIProxyAPI 社区也有人报告了完全相同的行为:GPT-5.5 在某些推理任务上会突然「短路」,跳过中间推导步骤,直奔 final_answer,然后给出错误答案。

而这个问题被系统性地量化之后,数字更加触目惊心。

一位叫 Felagund 的开发者从 Codex 的 token_count 元数据中提取了 2026 年 2 月到 6 月的海量响应记录,发现 GPT-5.5 的推理 Token 分布存在三个异常「尖峰」:516、1034 和 1552。这三个数字恰好是 516 的倍数(516 × 1、516 × 2、516 × 3),看起来就像模型内部存在某种以 516 为单位的「推理预算」分配机制。

数据不会说谎#

来看这张关键数据表,它比较了不同模型在推理 Token ≥ 516 的响应中,恰好命中 516 的比例:

模型响应记录数恰好 516 / ≥516 比例
gpt-5.575,40144.0%
gpt-5.425,21419.8%
gpt-5.2247,5750.34%
gpt-5.3-codex13,3330.0%
gpt-5.3-codex-spark26,1790.0%

GPT-5.5 的表现是其他模型的 33 倍以上。更关键的是,GPT-5.5 只占所有响应的 19.3%,却贡献了 82.0% 的 516-Token 事件

这种异常的集中度很难用「自然分布」来解释。如果推理 Token 数是任务难度的自然反映,那我们看到的应该是一个平滑的分布曲线,而不是在几个固定位置上的尖峰。

时间趋势同样令人担忧:

月份恰好 516 / ≥516平均推理 TokenP90 推理 Token
2 月0.11%268.1772
3 月2.45%256.8723
4 月4.25%228.7669
5 月53.30%106.9344
6 月35.84%168.5515

从 2 月到 5 月,516 聚类比例从 0.11% 飙升到了 53.3%,增长了 480 多倍。与此同时,平均推理 Token 数从 268 降到了 107,P90 从 772 降到了 344。

换句话说,GPT-5.5 不仅越来越频繁地在 516 处「踩刹车」,而且整体的推理深度也在明显缩水。它变「懒」了。

一颗糖果暴露的问题#

理论上,数据分析只能揭示「存在聚类异常」,但不能证明「聚类导致了错误」。但一位开发者用一个巧妙的实验填补了这个空缺。

他设计了一道组合数学题:一个不透明的袋子里有三种口味的糖果(苹果、桃子、西瓜),每种口味又分圆形和五角星形两种形状。问题是:至少需要取出多少颗糖,才能保证同时拥有形状不同的苹果味和桃子味糖果?

正确答案是 21。这是一个需要仔细推理的鸽巢原理变体,不认真想很容易出错。

开发者用 GPT-5.5 + xhigh 推理强度反复测试。结果令人震惊:凡是推理 Token 恰好为 516 的运行,回答全部错误;凡是推理 Token 超过 516 的运行,回答全部正确。

在失败的运行中,日志显示了一个关键细节:

reasoning_output_tokens: 516
phases: ["final_answer"]

模型跳过了「commentary」(中间推导)阶段,直接进入了 final_answer。就像考试时看了一眼题目就写下答案,中间没有任何草稿纸上的推导痕迹。

这就是 516 现象的实质:它不是一个 Token 数量的统计趣闻,而是一个推理深度被截断的症状。当模型在 516 这个位置被「切断」时,它还没来得及完成完整的推理链,只能给出一个仓促的结论。

可能的解释#

目前 OpenAI 尚未对此做出官方回应(该 Issue 至今保持 open 状态),但社区提出了几种有说服力的假设:

假设一:推理预算硬上限。 最直白的解释是,GPT-5.5 在 Codex 环境中被设置了某种「推理预算」。516 可能是某个内部批处理大小或上下文窗口对齐的产物。当推理过程恰好在这个边界处结束时,模型会直接输出结果,而不是「申请」更多预算继续思考。

假设二:优化副作用。 6 月的数据相比 5 月有所改善(35.84% vs 53.30%),说明 OpenAI 可能在调整推理调度策略。5 月的极端峰值可能与某次面向吞吐量的优化有关:为了提高并发处理能力,缩短了单次推理的最大 Token 配额,但这个配额恰好切在了很多中等复杂度任务的推理中途。

假设三:模型架构特性。 516 不是 512(2^9,常见的对齐边界),而是 516 = 512 + 4。这 4 个 Token 的余量暗示可能是某种「推理完成标记」或「EOS padding」的结构性产物。1034 = 516 × 2 + 2 和 1552 = 516 × 3 + 4 的偏移也暗示这不是简单的截断,而是一个内部预算分配器的离散台阶。

对 Codex 用户意味着什么#

如果你是 Codex 的重度用户,这里有几个实用的启示:

第一,复杂任务优先用最新模型。 数据清楚显示,gpt-5.3-codexgpt-5.3-codex-spark 的 516 聚类比例是 0.0%。如果你的任务需要深度推理(架构设计、复杂重构、多文件协调),回退到 GPT-5.3 系列可能比 GPT-5.5 更可靠。

第二,关注推理强度设置。 虽然 516 异常在 xhigh 模式下已被明确复现,但中低推理强度的数据尚未被系统分析。选择 high 而非 xhigh 可能让推理预算分配更均匀,避免触发固定预算边界。

第三,验收时要「看草稿」。 如果 Codex 的响应速度快得不正常,或者输出中没有中间推导过程(在会话日志中表现为缺少 commentary 阶段),提高警惕。可以要求模型「show your reasoning step by step」来强制触发更长的推理链。

第四,这个 Bug 可能比你想象的更贵。 每一次「516 短路」都意味着你消耗的 Token 配额被浪费在了一个不完整的推理上。44% 的 GPT-5.5 响应落在这个区间,相当于近一半的推理成本可能没有产生有效价值。

一个未完的故事#

截至 2026 年 7 月 22 日,GitHub Issue #30364 仍然处于 open 状态,有 183 条讨论。OpenAI 尚未给出明确的技术解释或修复时间表。

但数据不会骗人。390,195 次响应、865 个会话、跨越 5 个月的时间窗口,所有证据都指向同一个结论:GPT-5.5 在 Codex 中的推理分配机制存在问题,表现为以 516 Token 为单位的「推理预算墙」,这个问题在 5 月达到顶峰(53.3% 的响应被截断),6 月虽有改善但仍在 35% 以上。

这是一个提醒:AI 编程工具的能力不仅取决于模型的「智力」,也取决于推理基础设施如何分配计算资源。一个精心训练的顶级模型,可能因为底层的 Token 预算管理不善,在某些任务上表现得像「降智」了一样。

下一次 Codex 给你一个明显错误的答案时,不妨去日志里看一眼 reasoning_output_tokens。如果那个数字恰好是 516、1034 或 1552,你知道发生了什么。


参考来源: