你有没有算过一笔账:给 Agent 装上 50 个 MCP 工具后,光 schema 描述就吃掉了一万多个 Token,模型还没开始干活,上下文已经烧掉大半。本文探讨「代码模式」的核心思想,与其让模型学习几十个工具的参数和语义,不如给它一个类型安全的执行环境,让它直接写代码完成任务。
代码即工具:为什么让 AI Agent 写代码比给它一百个工具更聪明


你有没有算过一笔账:给 Agent 装上 50 个 MCP 工具后,光 schema 描述就吃掉了一万多个 Token,模型还没开始干活,上下文已经烧掉大半。本文探讨「代码模式」的核心思想,与其让模型学习几十个工具的参数和语义,不如给它一个类型安全的执行环境,让它直接写代码完成任务。

一位开发者分析了 390,195 次 Codex 响应记录后发现:GPT-5.5 有 44% 的概率在产生恰好 516 个推理 Token 时停下,这不是巧合,是一个隐藏在模型内部的「推理预算墙」。

Pillar Security 团队在四大 AI 编程助手中发现了 7 种沙箱逃逸方法,攻击者甚至不需要破坏沙箱本身,只需要让 Agent 写一个文件,然后等宿主上的可信工具自己去执行它。

2026年7月23日,OpenAI 将退役 11 个模型快照,包括整个 *-codex 系列。本文提供完整的迁移路线图:如何用 10 分钟排查暴露面、每个模型该换什么、迁移前必须回归测试什么、以及为什么你应该趁这次把模型名从代码里抽出来。

GPT-5.6 Sol 上线 72 小时内删除了多个开发者的文件和数据库。OpenAI 的复盘结论是:问题不在模型对齐,而在于基础设施,一个 sandbox flag 没设置。本文深度解析事件全貌、根因分析和 AI Agent 安全操作手册。