有人让 Codex 连续自主工作 14 天、提交上千次,把一段 GPU 矩阵分解内核提速了 232 倍。本文复盘这套「自动研究」方法论:什么样的任务值得放养、/goal 与 /btw 怎么用、如何用「候选束」帮模型逃离局部最优。
让 Codex 自主跑 14 天,内核提速 232 倍:一次「自动研究」实战复盘


有人让 Codex 连续自主工作 14 天、提交上千次,把一段 GPU 矩阵分解内核提速了 232 倍。本文复盘这套「自动研究」方法论:什么样的任务值得放养、/goal 与 /btw 怎么用、如何用「候选束」帮模型逃离局部最优。

用 Codex 这类编程智能体干活时,真正拖慢进度的往往不是模型写错代码,而是它在无数个小节点上替你做了默认决定。本文拆解隐性假设带来的三个代价,介绍「结构化舵轮」的思路:用一个更便宜的观察者子代理把隐形决策捞出来,变成可勾选、可下拉、可固定的开关。

OpenAI 建了一个 Codex 项目展示区,把自家用 Codex 构建的作品和配套提示词全部公开。本文拆解其中三个项目的提示词设计思路,提炼出可直接复用的实战技巧。

一位开发者让 Codex 用八轮迭代优化自己的 AGENTS.md,每轮都在真实 PR 上做评测。结果出人意料:在训练集上表现最好的版本,在干净的留出集上反而退步了。这个实验揭示了一个被大多数人忽略的事实,听起来合理的指令,不一定是好的干预。