Internet Archive
PulseAugur coverage of Internet Archive — every cluster mentioning Internet Archive across labs, papers, and developer communities, ranked by signal.
9 天有情绪数据
-
互联网档案馆提供历史AI背景以反驳“被吹捧的Eliza”的说法
互联网档案馆提供了早期人工智能系统(如Eliza)的历史背景,以反驳当前人工智能炒作仅仅是过去技术迭代的说法。该倡议旨在提供对人工智能演变更细致的理解,超越与旧系统的简单比较。
-
Aaron Swartz 纪念馆面临旧金山的官僚障碍
在旧金山建立一个公共纪念馆被证明是一个艰苦的过程,即使有资金和社区支持。纪念 Aaron Swartz 的项目面临着重大的官僚障碍,包括在许可程序开始之前就需要一份设计文件。尽管面临这些挑战,纪念馆最终在互联网档案馆揭幕,并继续努力寻找合适的公共公园地点。
-
作者:知识产权法不足以保护工人免受AI的影响
作者认为,依赖知识产权法,特别是版权法,来保护艺术家和工人免受人工智能驱动的失业是一个错误的策略。虽然扩大版权范围以防止AI训练数据被抓取可能看起来是一个解决方案,但它可能会损害归档和研究等有益活动。此外,作者认为版权作为一种财产权,并不是解决AI对劳工和隐私影响的正确框架,并建议这些问题需要不同的法律保护。
-
AI公司被敦促向互联网档案馆捐赠图书扫描件
一位互联网用户对那些从事图书扫描的AI公司没有主动提出将扫描材料捐赠给互联网档案馆表示惊讶。这一建议突显了AI开发者与数字保存组织之间潜在的合作途径。
-
人工智能对知识保存的影响引发辩论:亚历山大图书馆的比喻被探讨
一场讨论质疑人工智能的进步是否对知识保存构成威胁,并使用了焚烧亚历山大图书馆的比喻。内容表明,人工智能对信息获取和保存的影响常常被夸大,而人工智能实际上可以支持互联网档案库等图书馆和档案馆。对话强调了这些机构在保护文化遗产方面的重要性。
-
人工智能公司为训练数据销毁书籍,引发文化遗产担忧
据报道,科技公司正在购买和销毁旧书,将其内容用作人工智能模型的训练数据。这种做法涉及剪断书脊和扫描页面,因其破坏性和对文化遗产的漠视而受到批评。虽然人工智能需要大量的文本(包括书籍)进行训练,但存在非破坏性的替代扫描方法,例如Google已获得专利并由Internet Archive使用的方法。争论的焦点在于数字化是否应作为公共利益,同时保存文本和实体物品,还是作为数据的私人提取,将书籍仅仅视为原材料。
-
Nick Heer:大型语言模型威胁集体文化和信息网站
Nick Heer 认为,大型语言模型对集体文化和信息的保存有害。他指出了对互联网档案库和维基百科等重要资源可能产生的负面影响。Heer 认为,大型语言模型的功能方式可能会破坏这些关键知识库的可持续性和可访问性。
-
菲斯克大学计划建设数据中心;互联网档案馆反对“好机器人”禁令
菲斯克大学计划在其纳什维尔校区建设一个数据中心,作为其9亿美元校园开发计划的一部分,校长Agenia Clark博士强调了其在增强学术机会方面的作用。与此同时,互联网档案馆正在纽约倡导反对《隐形爬虫禁止法案》,敦促州长Hochul否决该法案。该组织与电子前哨基金会和其他公民自由组织一起认为,该立法不公平地针对图书馆和研究人员使用的有益机器人,而不是专注于恶意人工智能驱动的网络抓取行为。
-
Internet Archive、EFF敦促纽约州长否决爬虫披露法
Internet Archive 与电子前哨基金会(Electronic Frontier Foundation)及其他公民社会团体一道,敦促纽约州州长霍赫尔(Hochul)否决《隐形爬虫禁令法》(Stealth Crawler Prohibition Act)。该拟议法律旨在通过要求所有自动化工具披露其身份和目的来打击滥用AI进行网络抓取行为。然而,批评者认为,该法案将迫使有益的爬虫(用于网络存档、研究和新闻业)暴露其运作方式,可能…
-
Reddit 收紧 API 访问权限,针对 AI 模型训练和第三方应用
Reddit 正在对其 API 访问实施重大变更,旨在限制未经授权的抓取并更一致地执行政策。这些变更紧随之前的行动,例如起诉 Perplexity 和 Anthropic、阻止 Internet Archive,以及在 2023 年收取 API 访问费用,最初的目的是阻止 AI 公司免费使用 Reddit 数据进行模型训练。该公司要求第三方应用迁移到其开发者平台,只有获得明确批准的应用才能获得豁免。
-
AI实验室竞相收购并销毁珍本书籍以获取内容
据报道,人工智能实验室正在收购数百万册珍本书籍,扫描其内容,然后销毁实体副本。这种做法引发了对大规模销毁独特且已绝版文本的担忧。在这次书籍收购趋势的背景下,提到了Google、OpenAI、Microsoft、Meta和Amazon等公司。
-
互联网档案馆被视为社区LLM训练数据来源
互联网档案馆正被考虑作为未来社区主导的大型语言模型(LLMs)的潜在训练数据来源。这种方法可以解决数据中心化、AI数据中心的环保影响以及过度抓取对网站造成的压力等问题。此类项目的一个关键挑战将是确保所用数据已获得LLM训练的适当许可,因为许多网站都有严格的版权规定或要求署名。
-
AI生成内容正使互联网多样性降低,而非准确性降低
新研究表明,AI并未主要导致互联网准确性下降,而是多样性下降。斯坦福大学、伦敦帝国理工学院和互联网档案馆的研究人员的一项研究发现,目前占新网站35%的AI生成内容,倾向于生成全面、结构良好且乐观的答案,并使用相似的语言得出相似的结论。这种同质性,而非彻头彻尾的虚假信息,被认为是网络信息格局的新兴威胁。
-
数字信息保存面临挑战,探讨长期知识传承
数字信息的保存是一个重大挑战,像互联网档案馆和IPFS(星际文件系统)这样的尝试只解决了问题的一部分。作者探讨了跨代传递人类知识和思维方式的困难,将历史上的模拟方法与数字时代的短暂性进行对比。在承认语言漂移和制度衰败可能阻碍长期知识传承的同时,文章提出探索新颖的方法,例如将信息蚀刻到或嵌入晶体中,作为存储海量数据的潜在解决方案。
-
开发者构建工具以恢复 105.9TB 被删除的 Webshots 照片
一位开发者创建了一个免费工具,用于从已停用的 Webshots 平台恢复照片。该平台在 2012 年删除了用户内容。Archive Team 此前已保存了 105.9TB 的数据,但在 2016 年左右提取服务失败后,访问权限丢失。新工具利用 Wayback Machine 的 CDX API 来重建用户相册并检索原始分辨率的照片和标题,这个过程花费了开发者十多年的时间来构建。
-
汉娜蒙塔娜Linux通过现代Debian和KDE Plasma重制版复兴
汉娜蒙塔娜Linux,一个致敬迪士尼频道情景喜剧的小众操作系统,在近二十年后复兴。新版本HML26基于Debian构建,并采用了重新设计的KDE Plasma桌面环境。此次重制版包含了现代安全补丁和改进的软件支持,使其能够像其2009年的原始版本一样用于当前的网页浏览和应用程序安装。
-
生物多样性遗产图书馆免费分享6400万页科学文献
生物多样性遗产图书馆(BHL)正在向公众免费开放6400万页科学知识。这个庞大的数字图书馆旨在通过提供海量科学文献的访问权限,让自然世界爱好者受益。史密森尼学会和多所大学等机构参与了这项倡议。
-
新闻网站屏蔽互联网档案馆;苹果发布 AI 驱动的 Siri
新闻机构因担心 AI 公司抓取内容而屏蔽了互联网档案馆的 Wayback Machine。另外,苹果在 2026 年 WWDC 上发布了更新,包括增强版的 Siri 和与其产品提供动力的 Google AI 合作的暗示。
-
新闻网站因担心被人工智能抓取而阻止互联网档案馆
几家新闻机构已阻止互联网档案馆,理由是担心该非营利组织正在帮助人工智能公司抓取受版权保护的内容。此举源于互联网档案馆在提供历史网络数据访问方面的作用,这些数据可能被用于训练大型语言模型。这一情况凸显了内容创作者、档案机构和人工智能发展需求之间日益紧张的关系。
-
340家美国新闻媒体因担忧AI训练而屏蔽互联网档案馆
美国约有340家地方新闻媒体现已屏蔽互联网档案馆,较今年早些时候显著增加。此举主要是出于对AI公司可能使用互联网档案馆的存储库作为训练数据的担忧。一些出版商提出了对其作品被无偿使用的合理担忧,而批评者则认为此举阻碍了对历史记录的访问,而这对于独立新闻业和公众利益至关重要。