Pillar Security 团队在四大 AI 编程助手中发现了 7 种沙箱逃逸方法,攻击者甚至不需要破坏沙箱本身,只需要让 Agent 写一个文件,然后等宿主上的可信工具自己去执行它。
沙箱不是银弹:7 种方式让 AI 编程助手从「信任的文件」中逃逸


Pillar Security 团队在四大 AI 编程助手中发现了 7 种沙箱逃逸方法,攻击者甚至不需要破坏沙箱本身,只需要让 Agent 写一个文件,然后等宿主上的可信工具自己去执行它。

GPT-5.6 Sol 上线 72 小时内删除了多个开发者的文件和数据库。OpenAI 的复盘结论是:问题不在模型对齐,而在于基础设施,一个 sandbox flag 没设置。本文深度解析事件全貌、根因分析和 AI Agent 安全操作手册。

AI 写代码比人审代码快 100 倍,信任危机已经到来。本文介绍语义合约如何通过类型化蓝图、编译期检查和可组合性,让 AI 生成的代码变得可信。

让 AI 审查 AI 写的代码,听起来很美,实际做起来问题一大堆。审查循环往往不会收敛,每一轮都在加补丁、加文字、加伪代码。Convergo 这个开源插件用「新鲜审查者」和「摄入优先」两条核心规则,把发散的螺旋扭成了收敛的环。

大多数 AI 助手在它们最不了解的时候反而最自信。Aletheia 反其道而行之,用一个「信念→行动→观察→更新」的循环,让 AI 学会区分真正的知道和假装知道。