Codex 的 /goal 让 Agent 跨轮次追一个目标,直到完成或预算耗尽。但真正决定长任务成败的不是模型能力,而是三件事:压缩之后审计要求会不会丢、谁给完成结果判卷、预算是闸门还是断路器。这篇文章拆解三个失效点,以及把实质写进文件、把人工审批变成可判定检查项这两个具体解法。
会自我欺骗的循环:Codex /goal 的三个失效点,和堵住它的两个工程手段


Codex 的 /goal 让 Agent 跨轮次追一个目标,直到完成或预算耗尽。但真正决定长任务成败的不是模型能力,而是三件事:压缩之后审计要求会不会丢、谁给完成结果判卷、预算是闸门还是断路器。这篇文章拆解三个失效点,以及把实质写进文件、把人工审批变成可判定检查项这两个具体解法。

Archestra 团队用一个 Slack 螃蟹表情触发编码 agent,自动拉起环境、排查 bug、自审代码、录演示视频,一路修到 PR 提审。但真正棘手的是:当 agent 同时拥有内部数据读取、网络访问和公开仓库推送权限,数据会流向哪里?他们用 OpenAPPA 本地策略引擎给数据打上「内部」标记,在工具调用前拦下越界操作。