DCLM
PulseAugur coverage of DCLM — every cluster mentioning DCLM across labs, papers, and developer communities, ranked by signal.
-
新的CuraWeb语料库通过优化数据策展提升LLM性能
研究人员开发了CuraWeb,一个包含2万亿token的新的英文语料库,旨在改进大型语言模型的预训练数据。与以往只关注单一优化目标的旧方法不同,CuraWeb采用了一种新颖的框架,能够联合优化数据的质量、冗余度和多样性。该方法利用双轨清理和混合去重技术,并通过多目标采样器进行平衡。实验表明,将CuraWeb应用于Common Crawl数据,其性能显著优于现有数据集,在各种基准测试中平均性能提升了1.8%,尤其是在知识密集型和推理任务方面。
-
AI模型在复制和可视化文本方面遇到困难,新研究表明
两篇新研究论文指出了当前AI模型的局限性。一篇题为“Frontier Language Models Struggle to Copy”的论文揭示,即使是先进的大型语言模型也因依赖位置编码而在简单的字符串复制任务中失败。为解决此问题,研究人员提出了2D-RoPE,它将文本组织在二维网格中,显著提高了复制能力。第二篇论文“VISTA-Bench”引入了一个基准来测试视觉语言模型(VLMs)在可视化文本上的表现。研究发现了一个显著的差距,…
-
扩大规模可改善大型语言模型的社会模拟能力,但存在局限性
一项新的研究论文探讨了扩大大型语言模型(LLMs)规模对其执行社会模拟能力的影响。研究发现,增加LLMs的计算规模,特别是使用Qwen3架构,显著提高了在意见建模和行为模拟等领域的性能,尤其对于英语网络数据中代表性强的群体。然而,对于纵向预测和代表性不足的观点,改进效果不太可靠,并且扩大规模并未增强与人类认知偏差或启发式方法的校准。
-
Spokes框架将AI预训练数据多样性提升489%
研究人员开发了一个名为Spokes的新概率多样化框架,该框架可优化预训练数据选择的多样性。该方法利用G-Vendi分数和指数梯度下降来创建比随机抽样多样性显著更高的数据子集,G-Vendi分数提高了489%。当应用于FineWeb和DCLM等数据集时,Spokes在下游性能上平均比随机抽样提高了0.4至0.5个百分点。通过Spokes联合优化质量和多样性可获得最佳结果,比基线提高了1.4至1.5个百分点。
-
研究人员追踪1B级语言模型中的注意力回路形成
一篇新研究论文调查了语言模型中注意力回路的出现,特别追踪了不同类型的注意力头在不同模型架构和训练数据集中的形成方式。研究发现,模型中的早期层始终未能开发出特定类型的注意力头,并且这些回路的形成可能遵循不同的模式,例如渐进式增长或急剧的阶段性转变。重要的是,研究表明,像归纳(induction)这样的关键回路的识别可以在训练过程早期实现,这表明模型能力与训练完成前的回路发展密切相关。