互联网档案馆正被考虑作为未来社区主导的大型语言模型(LLMs)的潜在训练数据来源。这种方法可以解决数据中心化、AI数据中心的环保影响以及过度抓取对网站造成的压力等问题。此类项目的一个关键挑战将是确保所用数据已获得LLM训练的适当许可,因为许多网站都有严格的版权规定或要求署名。 AI
影响 可能为LLM训练数据提供去中心化的替代方案,缓解资源集中和环境影响的担忧。
排序理由 该条目讨论了一个现有实体(互联网档案馆)在LLM训练数据方面的潜在未来用例,以问题的形式提出并探讨了挑战,而不是报道具体的事件或发布。
在 Mastodon — fosstodon.org 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →