PulseAugur
中
实时 21:30:49
实体 The Pile

The Pile

PulseAugur coverage of The Pile — every cluster mentioning The Pile across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
7
90 天内 7
发布 · 30天
0
90 天内 0
论文 · 30天
4
90 天内 4
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 8 条
  1. TOOL · CL_239933 ·

    Anthropic 因涉嫌盗用 AI 训练数据被起诉,索赔数十亿美元 · 跟踪 1 个来源

    Anthropic 公司面临索尼音乐出版公司和华纳查普尔公司提起的重大诉讼,指控该公司的人工智能模型在未经许可的情况下,使用了数万首受版权保护的歌曲进行训练。原告寻求可能高达数十亿美元的赔偿,引用了每件侵权作品高达 15 万美元的法定损害赔偿,以及因删除版权管理信息而产生的额外罚款。此法律行动紧随 Anthropic 与作家就涉嫌侵犯版权达成的一项 15 亿美元的和解协议之后,这表明其数据获取实践存在潜在问题,可能给这家人工智能公司及…

  2. TOOL · CL_225677 ·

    音乐出版商因数据管道中的DMCA违规起诉Anthropic

    音乐出版商Sony Music Publishing和Warner Chappell Music已提起诉讼,起诉Anthropic,并点名联合创始人Dario Amodei和Benjamin Mann。诉讼的核心在于加州北区法院受理的指控,即Anthropic在数据处理阶段,特别是在文本提取前剥离网站页脚时,涉嫌违反《数字千年版权法》(DMCA),移除了版权管理信息。虽然出版商寻求巨额法定损害赔偿,但诉讼中关于数据管道实践的技术指控可…

  3. COMMENTARY · CL_191499 ·

    LLM 因训练数据普遍性而默认使用 Markdown

    像 ChatGPT、Claude 和 Gemini 这样的大型语言模型,之所以经常默认使用 Markdown 来格式化它们的回答,是因为这种标记语言在它们的训练数据中非常普遍。Markdown 最初是为博主设计的,可以轻松地将纯文本转换为 HTML,后来通过 GitHub 等平台和 Obsidian 等工具在开发者社区中成为标准。它以极少的标记来构建文本的效率,使其既适合人类阅读,也适合机器解析,从而导致模型在没有明确指令的情况下自然…

  4. TOOL · CL_145854 ·

    新方法高效恢复神经网络组件

    研究人员开发了一种名为定向参数分解(tPD)的新方法,以提高分析神经网络组件的效率。传统的参数分解(PD)计算成本高昂,而tPD只关注处理特定感兴趣输入的特定组件。该方法在处理在The Pile上训练的Transformer语言模型时进行了测试,成功识别并分离了计算电路。该方法显著减少了所需的计算资源,仅使用完整分解所需FLOPs的7%就提取了一个子模型,并允许精确操作已记忆的序列,同时对其他功能影响最小。

  5. RESEARCH · CL_106759 ·

    新的大语言模型训练方法优化数据调度以提高效率和性能

    研究人员开发了通过先进数据调度技术优化大语言模型(LLM)训练的新方法。一种方法是整体数据调度器(HDS),它使用多目标强化学习在预训练期间动态调整数据混合,从而在 The Pile 和 MMLU 等基准测试中显著提高训练效率和模型性能。另一种方法是自适应数据调度(ADS),它通过从统一数据采样转向语义集群和策略边界样本的自适应分布,专注于改进训练后强化学习,在推理基准测试中显示出优势。此外,一种使用精选数据集和最小 GRPO 设置的…

  6. RESEARCH · CL_65623 ·

    研究人员追踪1B级语言模型中的注意力回路形成

    一篇新研究论文调查了语言模型中注意力回路的出现,特别追踪了不同类型的注意力头在不同模型架构和训练数据集中的形成方式。研究发现,模型中的早期层始终未能开发出特定类型的注意力头,并且这些回路的形成可能遵循不同的模式,例如渐进式增长或急剧的阶段性转变。重要的是,研究表明,像归纳(induction)这样的关键回路的识别可以在训练过程早期实现,这表明模型能力与训练完成前的回路发展密切相关。

  7. RESEARCH · CL_16916 ·

    新的VPD方法分解语言模型参数,提高可解释性

    研究人员引入了对抗性参数分解(VPD),一种改进的语言模型参数解释方法。这项新技术建立在先前工作如随机参数分解(SPD)和基于归因的参数分解(APD)的基础上。VPD能够分解注意力层,这是可解释性方法在历史上一直面临的挑战领域,并构建归因图来可视化模型行为。

  8. RESEARCH · CL_00875 ·

    RWKV 项目复兴 RNN,挑战 Transformer 在大语言模型中的主导地位

    RWKV(Receptance Weighted Key Value)项目引入了一种新颖的架构,它复兴了循环神经网络(RNN),同时融入了通常在 Transformer 中发现的优势。这种方法旨在克服传统 Transformer 的扩展限制,尤其是在训练和推理方面,同时在推理基准测试中保持具有竞争力的性能。RWKV 项目的特点是其分布式、国际化且主要由志愿者驱动的社区,这与早期 EleutherAI 的努力有相似之处。