报告称 OpenAI 采集了超一百万小时 YouTube 视频来训练 GPT-4
本周早些时候,华尔街日报报导称 AI 公司在搜集高质量练习数据方面遇到了困难。今日,纽约时报具体介绍了 AI 公司处理此问题的一些办法,其间涉及到归于 AI 版权法含糊灰色区域的内容。
报导称
,OpenAI 迫切需要练习数据,并开发了 Whisper 音频转录模型来克服困难,转录了超越 100 万小时的 YouTube 视频来练习其最先进的大型言语模型 GPT-4。报导说到,OpenAI 在 2021 年耗尽了有用的数据供给,并在耗尽其他资源后评论了转录 YouTube 视频、播客和有声读物的可行性。此外,OpenAI 运用了包含来自 Github 的计算机代码、国际象棋走棋数据库和来自 Quizlet 的作业内容。
据称,OpenAI 公司知道这在法律上存在问题,但以为这是合理运用。泰晤士报则泄漏,OpenAI 总裁 Greg Brockman 亲身参加了所运用视频的搜集。
OpenAI 发言人 Lindsay Held 在一封电子邮件中向 The Verge 标明,该公司为其每个模型策划了“共同”的数据集,以“协助他们了解国际”并坚持其全球研讨竞争力。Held 弥补说,该公司运用“很多来历,包含揭露数据和非揭露数据的合作伙伴”,而且正在考虑生成自己的组成数据。
Google 发言人 Matt Bryant 在一封电子邮件中标明,该公司“看到了有关 OpenAI 活动的未经证明的陈述”,并弥补说“咱们的 robots.txt 文件(注:网站与爬虫间的君子协定)和服务条款都制止未经授权的抓取或下载 YouTube 内容”。
YouTube 首席执行官 Neal Mohan 近来在采访中揭露标明,虽然没有直接依据标明 OpenAI 运用 YouTube 视频来练习 Sora(文本生成视频的 AI 模型),但正告称这种行为违反了 YouTube 现行的渠道服务条款。
Meta 相同也遇到了数据可用性的约束,在泰晤士报听到的录音中,Meta 的 AI 团队为了尽力追逐 OpenAI,评论了未经答应运用版权著作的状况。该公司在阅读了“互联网上简直可用的英语书本、散文、诗篇和新闻文章”后,明显考虑采纳一些办法,例如付出图书答应费用,乃至直接收买一家大型出版商。