<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Prompt Injection on Codexer</title><link>https://codexer.com/tags/prompt-injection/</link><description>Recent content in Prompt Injection on Codexer</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Tue, 21 Jul 2026 09:00:00 +0800</lastBuildDate><atom:link href="https://codexer.com/tags/prompt-injection/index.xml" rel="self" type="application/rss+xml"/><item><title>沙箱不是银弹：7 种方式让 AI 编程助手从「信任的文件」中逃逸</title><link>https://codexer.com/posts/2026-07-21-ai-coding-sandbox-escape/</link><pubDate>Tue, 21 Jul 2026 09:00:00 +0800</pubDate><guid>https://codexer.com/posts/2026-07-21-ai-coding-sandbox-escape/</guid><description>&lt;p&gt;上周我们讨论了 GPT-5.6 Sol 因为一个没设置的 sandbox flag，在 72 小时内误删了多个开发者的文件和数据库。那条推文获得了 550 万次浏览，整个技术圈都在讨论「AI Agent 该不该有文件系统访问权限」。&lt;/p&gt;
&lt;p&gt;如果你以为给 Agent 套上沙箱就万事大吉了，这篇文章可能会让你重新坐直。&lt;/p&gt;
&lt;p&gt;Pillar Security 的安全研究团队花了几个月时间，在 Cursor、OpenAI Codex、Google Gemini CLI 和 Antigravity 这四款最流行的 AI 编程助手中，找到了 7 种沙箱逃逸方法。他们没有攻击沙箱本身，甚至没有尝试绕过任何安全边界。他们只是让 Agent 写了一个文件，然后静静地等着宿主系统上的可信工具自己去执行它。&lt;/p&gt;
&lt;p&gt;这 7 个发现被整理成一个系列，叫做「沙箱逃逸周」（Week of Sandbox Escapes），每天揭露一种新的攻击面。&lt;/p&gt;
&lt;h2 id="问题的本质文件不是惰性的"&gt;问题的本质：文件不是惰性的&lt;/h2&gt;
&lt;p&gt;所有 AI 编程助手的沙箱都画了一条看似清晰的线：Agent 在项目工作区内是可信的，宿主系统在外部是受保护的。这条线的逻辑是，「Agent 不能直接运行系统命令，所以它无法危害宿主」。&lt;/p&gt;
&lt;p&gt;但 Pillar 团队揭露了一个被忽视的事实：工作区内的文件不是惰性的。&lt;/p&gt;
&lt;p&gt;你的 IDE 和 CLI 工具无时无刻不在沙箱外运行自己的组件：Python 扩展在解析解释器路径，Git 集成在扫描仓库元数据，VS Code 在执行任务配置文件，hook 引擎在触发命令钩子，Docker Desktop 在暴露本地 socket。这些东西都是可信的，它们在沙箱外运行，而且它们会读取工作区里的文件。&lt;/p&gt;
&lt;p&gt;一个被沙箱约束的 Agent 可以完全遵守所有规则，同时精确地塑造那些被宿主组件读取的文件内容。攻击触发点呢？Prompt Injection，一段恶意指令藏在 README、Issue、依赖描述或 diff 里，它自己不会执行任何命令，但它会让 Agent 写下一个文件，这个文件随后被沙箱外的可信工具加载、解析或运行。逃逸就这样发生了，Agent 全程没出过沙箱。&lt;/p&gt;
&lt;p&gt;Pillar 将这 7 个发现归纳为四种失败模式，每一种都值得开发者认真对待。&lt;/p&gt;</description></item></channel></rss>