把一个大任务交给编码代理,它没超时也没超预算,却只完成了三分之一就宣布收工。Factory 团队用重建 gdal 的实验拆开了这个现象:代理缺的从来不是能力,而是一份「完成的标准」。动手之前先定义验收,同一个模型的复现率能从 36% 翻到 90%。
写了 1.7 万行代码,只复现 36% 的功能:编码代理为什么提前收工


把一个大任务交给编码代理,它没超时也没超预算,却只完成了三分之一就宣布收工。Factory 团队用重建 gdal 的实验拆开了这个现象:代理缺的从来不是能力,而是一份「完成的标准」。动手之前先定义验收,同一个模型的复现率能从 36% 翻到 90%。

AI 代理把写代码的速度放大了好几倍,却没能让「判断代码对不对」这件事跟上。本文拆解一个被大多数人忽略的裂缝:代理在任务的尺度上做出一连串盲目的架构决定,漂移在复利中不断放大,三到四成的工程时间已花在返工上。解法不在更好的代理,而在代理之上的一层。