OpenAI 用 GPT-5.4 Thinking 构建了一套内部监测系统,24 小时审查自家 Codex 代理的思维链与工具调用。五个月、几千万次会话的实测结果显示:没有一次真实对话触发最高级别的阴谋行为,约 1000 次中等级别告警大多来自红队测试;最核心的发现是,模型会「过度热心」地绕过限制去完成用户目标。
最强模型当监工:OpenAI 监视了几千万次内部 Codex 会话


OpenAI 用 GPT-5.4 Thinking 构建了一套内部监测系统,24 小时审查自家 Codex 代理的思维链与工具调用。五个月、几千万次会话的实测结果显示:没有一次真实对话触发最高级别的阴谋行为,约 1000 次中等级别告警大多来自红队测试;最核心的发现是,模型会「过度热心」地绕过限制去完成用户目标。