牛津大学图书馆藏书被曝用于OpenAI模型训练
IT时代网9月26日消息,一份内部文件显示,牛津大学已允许OpenAI利用博德利图书馆的历史典籍训练其人工智能模型,由OpenAI完成数字化的博德利藏书已被用来构建OpenAI的训练集。博德利图书馆是牛津大学主要研究图书馆,规模在英国仅次于大英图书馆。
牛津大学2025年3月宣布与OpenAI达成合作,使用对方软件对馆藏文献进行数字化,校方当时称此举将让学生和研究人员更便捷地查阅文献,公告并未提及资料会被用于模型训练。OpenAI发言人对合作回应称,已有超过十亿人在日常生活中使用这项技术,让它充分反映不同的文化、历史和视角至关重要。
一份依据《信息自由法》调取的会议纪要显示,包括博德利管理委员会成员在内的教职员工表达了两方面顾虑:与OpenAI合作可能引发声誉风险,且涉及高能耗技术,或与学校自身的环保承诺相冲突。截至2025年6月,博德利图书馆已向OpenAI提供12.5万份历史学位论文的扫描影印页,内容涵盖19至20世纪欧美高校博士论文,另有一份收录1万首曲目的16世纪宽边民谣珍藏集完成扫描。
后续商讨的数字化计划还涉及18世纪爱尔兰国家档案、小说家埃奇沃思的私人信函,以及科学家霍奇金关于青霉素研究的实验笔记。校方否认向公众和学生隐瞒机器学习用途,称合作的文献均已超出版权保护期,OpenAI的使用权为非排他性,图书馆保留自主发布权并将在未来几个月内逐步公开这批资料。在NextGenAI项目框架下,OpenAI已与波士顿公共图书馆、加州理工学院、麻省理工学院及密歇根大学等机构签署类似协议,牛津大学是其中唯一的英国成员。

注:本文综合自IT之家等,文中包含AI辅助创作的内容。
编辑:林一舟