大型语言模型面临训练数据短缺,因为互联网上可用的内容日益枯竭。为解决此问题,人工智能开发者正在收购和销毁大量实体书籍,特别是1970年代后出版的书籍,以将其内容数字化用于训练。一些北美法律专业人士将此做法称为“合理使用”,包括在提取数据后对书籍进行物理销毁,这种方法在美国比在欧洲更具法律可行性。 AI
影响 这一做法凸显了对训练数据的日益增长的需求,以及围绕人工智能开发数据获取的潜在伦理和法律挑战。
排序理由 该项目讨论了与人工智能训练数据相关的做法,但并未宣布新模型、研究或重要的行业事件。
在 Mastodon — mastodon.social 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →