一年前,编辑器里的代码几乎每一行都是自己敲的;今天,大部分代码是模型已经写好的 diff,你只负责读、判断、保留。真正的瓶颈从写得快不快,挪到了验证得准不准。这篇文章拆解这个位移,并给出结论:当 AI 写代码,验证就是新的实现,而判断力是我们手里最后一块不会被拿走的地盘。
「我发布了我没读过的代码」:当 AI 负责写,验证成了新的实现


一年前,编辑器里的代码几乎每一行都是自己敲的;今天,大部分代码是模型已经写好的 diff,你只负责读、判断、保留。真正的瓶颈从写得快不快,挪到了验证得准不准。这篇文章拆解这个位移,并给出结论:当 AI 写代码,验证就是新的实现,而判断力是我们手里最后一块不会被拿走的地盘。

把一个大任务交给编码代理,它没超时也没超预算,却只完成了三分之一就宣布收工。Factory 团队用重建 gdal 的实验拆开了这个现象:代理缺的从来不是能力,而是一份「完成的标准」。动手之前先定义验收,同一个模型的复现率能从 36% 翻到 90%。

AI 代理把写代码的速度放大了好几倍,却没能让「判断代码对不对」这件事跟上。本文拆解一个被大多数人忽略的裂缝:代理在任务的尺度上做出一连串盲目的架构决定,漂移在复利中不断放大,三到四成的工程时间已花在返工上。解法不在更好的代理,而在代理之上的一层。

OpenAI 工程师 Jeremy Lewi 用一套名为 Runme 的开源笔记本,把跑评估这类重复工作交给 Codex 执行,自己只负责审批和决策。本文拆解这套工作流的三个关键设计:持久的 goal、清晰的审批边界,以及让每一轮运行都沉淀成可复用上下文的飞轮机制。

很多人一看到 git、CLI 或代码,就习惯性地把活甩给 Codex,结果膨胀的不是执行速度,而是交接次数。真正的切分边界不该是「技术不技术」,而是「答案住在哪里」。本文给出一个五字段交接模板,帮你把交接时机找对。