报告称 OpenAI 采集了超一百万小时 YouTube 视频来训练 GPT-4

发布时间：2025-12-26 08:20:49

本周早些时候，华尔街日报报导称 AI 公司在搜集高质量练习数据方面遇到了困难。今日，纽约时报具体介绍了 AI 公司处理此问题的一些办法，其间涉及到归于 AI 版权法含糊灰色区域的内容。

报导称

，OpenAI 迫切需要练习数据，并开发了 Whisper 音频转录模型来克服困难，转录了超越 100 万小时的 YouTube 视频来练习其最先进的大型言语模型 GPT-4。

报导说到，OpenAI 在 2021 年耗尽了有用的数据供给，并在耗尽其他资源后评论了转录 YouTube 视频、播客和有声读物的可行性。此外，OpenAI 运用了包含来自 Github 的计算机代码、国际象棋走棋数据库和来自 Quizlet 的作业内容。

据称，OpenAI 公司知道这在法律上存在问题，但以为这是合理运用。泰晤士报则泄漏，OpenAI 总裁 Greg Brockman 亲身参加了所运用视频的搜集。

OpenAI 发言人 Lindsay Held 在一封电子邮件中向 The Verge 标明，该公司为其每个模型策划了“共同”的数据集，以“协助他们了解国际”并坚持其全球研讨竞争力。Held 弥补说，该公司运用“很多来历，包含揭露数据和非揭露数据的合作伙伴”，而且正在考虑生成自己的组成数据。

Google 发言人 Matt Bryant 在一封电子邮件中标明，该公司“看到了有关 OpenAI 活动的未经证明的陈述”，并弥补说“咱们的 robots.txt 文件（注：网站与爬虫间的君子协定）和服务条款都制止未经授权的抓取或下载 YouTube 内容”。

YouTube 首席执行官 Neal Mohan 近来在采访中揭露标明，虽然没有直接依据标明 OpenAI 运用 YouTube 视频来练习 Sora（文本生成视频的 AI 模型），但正告称这种行为违反了 YouTube 现行的渠道服务条款。

Meta 相同也遇到了数据可用性的约束，在泰晤士报听到的录音中，Meta 的 AI 团队为了尽力追逐 OpenAI，评论了未经答应运用版权著作的状况。该公司在阅读了“互联网上简直可用的英语书本、散文、诗篇和新闻文章”后，明显考虑采纳一些办法，例如付出图书答应费用，乃至直接收买一家大型出版商。

新闻详情