PulseAugur
实时 15:06:34
实体 DCLM

DCLM

PulseAugur coverage of DCLM — every cluster mentioning DCLM across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 4
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 4 条
  1. TOOL · CL_151954 ·

    新的二维位置编码方法提升了LLM的复制能力

    研究人员发现,即使是所谓的“前沿”大型语言模型,在精确复制其上下文窗口内的输入文本这一简单任务上也存在显著局限性。这种失败归因于Transformer架构中使用的位置编码方法,这些方法会创建阻碍精确复制的捷径。为解决此问题,提出了一种名为2D-RoPE的新方法,该方法将文本组织成二维网格,使复制成为一个更简单的检索任务。实验表明,使用2D-RoPE的Transformer模型在比标准模型长得多的输入长度下也能实现完美的复制,并且在大规…

  2. TOOL · CL_123168 ·

    扩大规模可改善大型语言模型的社会模拟能力,但存在局限性

    一项新的研究论文探讨了扩大大型语言模型(LLMs)规模对其执行社会模拟能力的影响。研究发现,增加LLMs的计算规模,特别是使用Qwen3架构,显著提高了在意见建模和行为模拟等领域的性能,尤其对于英语网络数据中代表性强的群体。然而,对于纵向预测和代表性不足的观点,改进效果不太可靠,并且扩大规模并未增强与人类认知偏差或启发式方法的校准。

  3. TOOL · CL_93256 ·

    Spokes框架将AI预训练数据多样性提升489%

    研究人员开发了一个名为Spokes的新概率多样化框架,该框架可优化预训练数据选择的多样性。该方法利用G-Vendi分数和指数梯度下降来创建比随机抽样多样性显著更高的数据子集,G-Vendi分数提高了489%。当应用于FineWeb和DCLM等数据集时,Spokes在下游性能上平均比随机抽样提高了0.4至0.5个百分点。通过Spokes联合优化质量和多样性可获得最佳结果,比基线提高了1.4至1.5个百分点。

  4. RESEARCH · CL_65623 ·

    研究人员追踪1B级语言模型中的注意力回路形成

    一篇新研究论文调查了语言模型中注意力回路的出现,特别追踪了不同类型的注意力头在不同模型架构和训练数据集中的形成方式。研究发现,模型中的早期层始终未能开发出特定类型的注意力头,并且这些回路的形成可能遵循不同的模式,例如渐进式增长或急剧的阶段性转变。重要的是,研究表明,像归纳(induction)这样的关键回路的识别可以在训练过程早期实现,这表明模型能力与训练完成前的回路发展密切相关。