多家AI公司被曝收购旧书训练
IT时代网7月28日消息,AI 公司把内存和存储资源吃得越来越紧之后,目光又转到了人类的文学遗产上。调查媒体 404 Media 报道,多家 AI 公司正通过中间商大批量收购二手书,目的是拿到高质量训练数据,同时尽量不引发公众反弹。
数据这事,量重要,质更重要。网上越来越多 AI 自己生成的低质内容,反向污染了训练环境,也让模型越学越"傻"。于是领先的 AI 公司掉头去翻人类写的东西,尤其偏爱 2022 年之前出版的纸质书——那会儿互联网还没被 AI 内容淹没,原创成色更足。
拿纸质书练模型不是新鲜事。深陷版权诉讼的 Anthropic 就曾砸数百万美元买实体书,拆出来喂给 Claude,用完再把书销毁。它主要从 Better World Books 进货。法院虽认定"用正版书训练"属合理使用,但 Anthropic 因为长期囤着一个含 700 万本盗版书的数据集,最终被判赔约 15 亿美元(约合 101.62 亿元人民币)。谷歌也挨了类似官司,一个出版商联盟近期起诉它未经授权用数百万本受版权保护的书训练 Gemini。
ISBNdb 这个收录超 1.11 亿本书目信息的数据库,也盯上了这门生意,专门给 AI 企业做起了大规模图书采购服务。404 Media 说,订单规模从一次 1000 本到 100 万本不等。有书商透露,今年 4 月以来生意反常地好:过去旺季一周才卖 20 本左右,近几个月每周能卖几百本,翻了约五倍。Alibris、Biblio 等平台上的同行也看到了类似的大宗采购。
怪事不少。采购对象几乎全是带 ISBN 的书,小说、教材、专业书通吃,毫无主题偏好;买家对价格也出奇地大方,高于市价也照单全收。Anthropic 版权案里,曾负责 Google Books 项目、后来牵头 Anthropic"巴拿马计划"数字化的汤姆·哈维证实,公司雇过好几家专业扫描公司做纸质书数字化。有的用非破坏性扫描,有的直接拆书送进工业扫描仪——后者更快更便宜,于是数百万本纸书被拆毁。
纸书对 AI 确实是座知识金矿,争议也随之而来。批评者担心,扫描方根本不会区分普通书和绝版珍本,稀有书一旦拆毁就永久退场;更关键的是,这些内容最终都进了 AI 公司的私有数据库,只服务训练,公众反而读不到了。代价也许是:人类换来更聪明的 AI,却可能失去以公开、可获取形式留给后代的那部分知识。

此图片为IT时代网AI生成的示意图
注:本文中包含AI辅助创作的内容。