如果把 100 条失败记录和一个性能指标交给 AI 编程代理,不提供任何专业工具,它能自己找出问题、修改提示词、提升模型表现吗?Andrew Jesson 的实验给出了令人惊讶的答案。
AI 代理的自我进化:Codex 与 Claude Code 如何自动分析失败、优化提示词


如果把 100 条失败记录和一个性能指标交给 AI 编程代理,不提供任何专业工具,它能自己找出问题、修改提示词、提升模型表现吗?Andrew Jesson 的实验给出了令人惊讶的答案。

OpenAI Codex 已经从实验工具变成了超过 400 万周活跃开发者的生产级系统。本文拆解 6 个经过实战验证的协作模式,从 Prompt 结构到会话管理,帮你把 Codex 的产出质量提升一个台阶。