IT之家 9 月 26 日消息,根据英国媒体《卫报》报道,在科技公司积极寻找新语料素材的背景下,牛津大学已同意让 ChatGPT 开发商 OpenAI 利用其博德利图书馆(Bodleian Library)的珍贵历史文献来训练人工智能模型。

IT之家注:博德利图书馆是牛津大学的主要研究图书馆,其藏书量在英国排名第二,仅次于大英图书馆。

一份内部文件显示,由 OpenAI 完成数字化的博德利藏书已被用于“构建 OpenAI 的训练数据集”。牛津大学于 2025 年 3 月宣布与该公司达成合作,利用 OpenAI 的软件对该校这座世界知名图书馆的馆藏进行数字化处理。

校方当时表示,此举将使学生和研究人员更方便地获取这些文献资料。然而,当时的合作公告并未明确提到这些资料会用于 OpenAI 模型的训练。

OpenAI 的一位发言人表示,公司很荣幸能够“通过当今的 AI 模型为后代保护人类的历史文化瑰宝”。

该发言人进一步补充道:“目前全球已有超过十亿人日常使用这项技术,因此确保它充分反映多元的文化、历史和视角至关重要。”

一份根据《信息自由法》获取的牛津大学会议记录显示,包括博德利管理委员会成员在内的教职员工都表达了担忧。他们不仅担心与 OpenAI 合作可能带来声誉风险,还指出这项合作涉及高能耗技术,可能对大学自身的环保承诺产生不利影响。

在一个名为“NextGenAI”的项目框架下,OpenAI 已与波士顿公共图书馆、加州理工学院、麻省理工学院以及密歇根大学等多家美国研究型图书馆签署了类似协议。牛津大学是该项目中唯一的英国成员。

截至 2025 年 6 月,博德利图书馆已向 OpenAI 提供了 12.5 万份历史学位论文的扫描页面,这些论文涵盖 19 至 20 世纪欧美高校的博士论文。其他已扫描的文献还包括一套罕见的 16 世纪“宽边民谣/街头民谣(Broadside Ballads)”珍藏集,共计 1 万首,记录了都铎王朝时期街头流传的歌词与乐谱。

此外,教职人员还讨论了后续的数字化计划,涉及 18 世纪爱尔兰国家档案、爱尔兰小说家玛利亚·埃奇沃思(Maria Edgeworth)的私人信函,以及多萝西·霍奇金(Dorothy Hodgkin)关于青霉素研究的实验笔记。

校方否认了向公众和学生隐瞒机器学习相关用途的指责。发言人表示,数字化确实是学校的核心目标,但教职员工始终明确承认,该项目同时会为模型提供训练数据。

牛津大学发言人表示:“通过与 OpenAI 合作完成数字化的文献资料规模有限,且均已超出版权保护期;此外,OpenAI 对这些资料的使用权是非排他性的。”

博德利图书馆同样保留了自主发布这些数字化资源的权利。在未来几个月内,图书馆将逐步在网络上公开提供这批资料,正如我们对待其他数字化合作成果一样。

事实上,该项目将帮助博德利图书馆惠及更广泛的公众群体,让那些原本难以接触到这些文献的人能够轻松查阅。