<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>推理机制 on Codexer</title><link>https://codexer.com/tags/%E6%8E%A8%E7%90%86%E6%9C%BA%E5%88%B6/</link><description>Recent content in 推理机制 on Codexer</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Wed, 22 Jul 2026 09:00:00 +0800</lastBuildDate><atom:link href="https://codexer.com/tags/%E6%8E%A8%E7%90%86%E6%9C%BA%E5%88%B6/index.xml" rel="self" type="application/rss+xml"/><item><title>Codex 推理「短路」之谜：为什么 GPT-5.5 总是在 516 个 Token 处停下？</title><link>https://codexer.com/posts/2026-07-22-codex-gpt55-reasoning-token-clustering/</link><pubDate>Wed, 22 Jul 2026 09:00:00 +0800</pubDate><guid>https://codexer.com/posts/2026-07-22-codex-gpt55-reasoning-token-clustering/</guid><description>&lt;p&gt;你用 Codex 写代码的时候，有没有遇到过这种情况：明明选的是 xhigh（最高推理强度），模型也「思考」了，但给出的答案却离谱得不像 GPT-5.5 的水平。更让人困惑的是，同样的问题，有时候答案完全正确，有时候却像换了个模型。&lt;/p&gt;
&lt;p&gt;这不是你的幻觉。一位开发者在分析了 &lt;strong&gt;390,195 次 Codex 响应记录&lt;/strong&gt;（覆盖 865 个会话）后，发现了一个惊人的规律：GPT-5.5 有 &lt;strong&gt;44% 的概率在产生恰好 516 个推理 Token 时停止思考&lt;/strong&gt;，而其他模型几乎不存在这种模式。&lt;/p&gt;
&lt;h2 id="516-魔咒"&gt;516 魔咒&lt;/h2&gt;
&lt;p&gt;如果你觉得「516」这个数字很眼熟，那不是巧合。在 GitHub 上，一个相关 Issue 的标题直接写道：「gpt-5.5 xhigh sometimes short-circuits with reasoning_output_tokens=516 and wrong final_answer」。更早的时候，CLIProxyAPI 社区也有人报告了完全相同的行为：GPT-5.5 在某些推理任务上会突然「短路」，跳过中间推导步骤，直奔 final_answer，然后给出错误答案。&lt;/p&gt;
&lt;p&gt;而这个问题被系统性地量化之后，数字更加触目惊心。&lt;/p&gt;
&lt;p&gt;一位叫 Felagund 的开发者从 Codex 的 &lt;code&gt;token_count&lt;/code&gt; 元数据中提取了 2026 年 2 月到 6 月的海量响应记录，发现 GPT-5.5 的推理 Token 分布存在三个异常「尖峰」：&lt;strong&gt;516、1034 和 1552&lt;/strong&gt;。这三个数字恰好是 516 的倍数（516 × 1、516 × 2、516 × 3），看起来就像模型内部存在某种以 516 为单位的「推理预算」分配机制。&lt;/p&gt;
&lt;h2 id="数据不会说谎"&gt;数据不会说谎&lt;/h2&gt;
&lt;p&gt;来看这张关键数据表，它比较了不同模型在推理 Token ≥ 516 的响应中，恰好命中 516 的比例：&lt;/p&gt;</description></item></channel></rss>