牛津大学博德利图书馆藏书被曝用于OpenAI训练

AI 驱动中国 宋谣 559次阅读
分享 微 Q 信
AI摘要
由 AI 生成 · 仅供参考

卫报称,牛津大学已允许OpenAI利用博德利图书馆历史典籍训练人工智能模型,内部文件显示相关数字化藏书已被用于构建OpenAI训练集,校方称资料均已超出版权保护期且图书馆仍会公开资源。

驱动中国9月26日消息,卫报称,牛津大学已允许ChatGPT开发商OpenAI利用其博德利图书馆的历史典籍训练人工智能模型。内部文件显示,由OpenAI完成数字化的博德利藏书已被用于“构建OpenAI的训练集”。

博德利图书馆是牛津大学主要的研究图书馆,也是英国规模仅次于大英图书馆的第二大图书馆。牛津大学于2025年3月宣布与OpenAI达成合作,使用OpenAI的软件对该校这座享誉世界的图书馆藏书进行数字化处理。校方当时表示,此举将让广大学生和研究人员更便捷地查阅这些文献资料,但当时的合作公告并未提及这些资料会被用于训练OpenAI的模型。

OpenAI的一位发言人表示,公司很荣幸能够促成“当今的AI模型为后世守护人类的历史文化瑰宝”。该发言人补充说,目前全球已有超过十亿人在日常生活中使用这项技术,因此让它充分反映不同的文化、历史和视角至关重要。

根据《信息自由法》调取的牛津大学会议纪要显示,包括博德利管理委员会成员在内的教职员工均表达了顾虑。他们担忧与OpenAI合作可能会引发声誉风险,还指出这项合作涉及高能耗技术,可能会对大学自身作出的环保承诺产生负面影响。

在一个名为“NextGenAI”的项目下,OpenAI已与包括波士顿公共图书馆、加州理工学院、麻省理工学院以及密歇根大学在内的多家美国研究型图书馆签署了类似协议。牛津大学则是该项目中唯一的英国成员。

截至2025年6月,博德利图书馆已向OpenAI提供了12.5万份历史学位论文的扫描影印页,其中涵盖了19至20世纪欧美高校的博士论文。其他已扫描的文献还包括一份罕见的16世纪“宽边民谣/街头民谣(Broadside Ballads)”珍藏集,共计1万首,记录了曾流传于都铎王朝街头巷尾的歌词与乐谱。

教职人员还商讨了后续的数字化计划,涉及18世纪爱尔兰国家档案、爱尔兰小说家玛利亚·埃奇沃思的私人信函,以及多萝西·霍奇金关于青霉素研究的实验笔记。

校方否认了向公众和学生隐瞒机器学习相关用途的指责。发言人表示,数字化确实是学校的核心诉求,但教职员工始终明确承认,该项目同时会为模型提供训练数据。

牛津大学发言人表示,通过与OpenAI合作完成数字化的文献资料规模有限,均已超出版权保护期;此外,OpenAI对这些资料的使用权是非排他性的。博德利图书馆同样保留了自主发布这些数字化资源的权利。在未来几个月内,图书馆将逐步在网络上公开提供这批资料,正如对待其他数字化合作成果一样。

该项目将帮助博德利图书馆惠及更广泛的公众群体,让那些原本难以接触到这些文献的人能够轻松查阅。

版权声明:本文由驱动中国整理发布,转载需注明出处与原文链接。如有疑问请联系 editor@qudong.com。
本文价值 ★★★★★ 3 1 人已评
登录后为本文打分
网友评论0 条评论
正在回复 的评论取消
评论加载中…
🔐

登录后参与互动

评论、点赞均可赚积分
连续签到、邀请好友也有奖励 🎁

电脑端: 微信扫码登录 微信内: 一键登录
✎ 我要投稿有独家观点或行业线索?向驱动中国投稿,审核采用后署名发布并获积分奖励。 去投稿 ›

微信扫一扫

打开微信「扫一扫」,分享本文到朋友圈或好友