FineWeb-Edu
PulseAugur coverage of FineWeb-Edu — every cluster mentioning FineWeb-Edu across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
研究发现:大型语言模型中期训练数据构成影响性能
研究人员探索了大型语言模型的中期训练阶段,发现跨不同领域的最佳性能是通过适度的(10%-40%)数据构成而非极端分配来实现的。这种最佳构成在随后的对齐阶段后仍然保持稳健且基本不变,表明中期训练的决策对模型的最终能力有显著影响。研究使用了Qwen3-8B-Base模型和KOR-Bench数据集来分析这些影响。
-
Graph Machine 架构用稀疏路由取代 Transformer 层
研究人员开发了一种名为 Graph Machine (GM) 的新架构,该架构利用稀疏动态路由和可微分指针追逐来实现线性状态复杂度。这种设计允许用最少的性能损失有效地替换密集 Transformer 层。在实验中,用 GM 稀疏层替换 Qwen3-0.6B 模型中 75% 的密集层,并在 157 亿个 token 上进行预训练,仅导致验证损失略有下降,在某些情况下甚至略有改善。
-
OrScale优化方法增强神经网络训练
研究人员推出了一种新颖的优化方法OrScale,旨在改进大型神经网络的训练。OrScale通过将信任比率原则适配到正交化设置中,来解决更新的方向和幅度问题。该方法旨在提供动态的、每层的标量调整,确保优化收益有效地分配到不同的架构组件中。在从1.25亿到160亿参数的模型上进行的实验表明,OrScale在无需额外超参数调优的情况下,可以媲美甚至超越Muon等现有方法。
-
TANGO模型引入了新颖的门控算子用于语言建模
研究人员推出了一种新颖的语言建模架构TANGO,该架构通过非线性门控算子聚合令牌信息。该方法用单个跨令牌门控残差更新取代了标准的Transformer组件。其变体WANGO通过处理最近的窗口并使用旧数据的前缀统计信息,提供了线性复杂度。尽管TANGO的操作次数较高,但TANGO和WANGO在FineWeb-Edu、Lean和DeepMind Mathematics等基准测试上的表现均优于其他模型。
-
新的DeltaMomentum优化器加速深度学习训练
研究人员推出了一种新颖的深度学习优化器动量更新方法——DeltaMomentum。与使用固定指数移动平均率的传统方法不同,DeltaMomentum根据特定方向梯度更新的频率动态调整遗忘率。这种受线性层梯度结构启发的基于键值对的方法旨在更有效地清除陈旧方向并提高训练速度。实验表明,DeltaMomentum的实现版本DeltaAdamW在包括大型语言模型和图像分类任务在内的各种模型规模和数据集上,与标准的AdamW相比,在显著更少的步…
-
用户花费200美元从头开始训练了一个11亿参数的LLM,并分享了代码和模型
一位用户仅花费约200美元就从头开始成功训练了一个拥有11亿参数的大型语言模型。该模型名为'gemmeh',在fineweb-edu数据集的200亿个token上进行了预训练,然后使用LoRA在openhermes数据集上进行了微调,以创建一个能够进行聊天的模型。该用户分享了该项目的代码、模型权重和一个演示网站,并详细介绍了架构选择和训练过程。
-
新的信任域框架增强了优化中自适应矩估计
研究人员引入了一个新颖的信任域框架,用于分析随机梯度优化中自适应矩估计方法的行为。该框架将单个权重的更新步长幅度限制在由p阶矩约束定义的信任域内,其中p的取值范围可以是从2到4。由此产生的机制,特别是四阶矩实现,在信任域约束较弱时显示出优势,而二阶矩实现则在更强的约束下与现有方法竞争,通常能带来更低的验证损失。
-
新的CuraWeb语料库通过优化数据策展提升LLM性能
研究人员开发了CuraWeb,一个包含2万亿token的新的英文语料库,旨在改进大型语言模型的预训练数据。与以往只关注单一优化目标的旧方法不同,CuraWeb采用了一种新颖的框架,能够联合优化数据的质量、冗余度和多样性。该方法利用双轨清理和混合去重技术,并通过多目标采样器进行平衡。实验表明,将CuraWeb应用于Common Crawl数据,其性能显著优于现有数据集,在各种基准测试中平均性能提升了1.8%,尤其是在知识密集型和推理任务方面。
-
Möbius RoPE 增强了语言模型中上下文内检索的可靠性
研究人员开发了一种名为 Möbius RoPE 的新位置编码技术,该技术利用反周期边界条件来提高语言模型中上下文内检索的可靠性。该方法应用于在 FineWeb-Edu 标记上训练的模型,在检索准确性方面显示出显著提高,特别是对于位于上下文窗口末尾的“针”(需要检索的信息)。虽然与标准 RoPE 相比,混合模型在困惑度方面没有变化,但它们实现了更高的检索可靠性基线,这表明该方法提供了一种成本效益高的方式来缓解检索失败。
-
用户在 1B tokens 上训练了 0.5M 参数模型 Silia-v2
一位用户使用 FineWeb-Edu 数据集中的 10 亿个 token 训练了一个拥有 0.5 百万参数的小型语言模型。该模型名为 Silia-v2,是对先前研究论文的迭代,并采用了 Qwen 的 HydraHead 和 Apple 的 Attention Free Transformer 等架构改进,以降低计算需求。该模型已在 HellaSwag、PIQA 和 LAMBADA 数据集上与其他小型模型进行了基准测试。
-
研究人员分析Transformer注意力机制和前馈网络 · 跟踪2个来源
两篇新研究论文探讨了Transformer模型的基本组成部分,特别关注注意力机制与前馈网络的作用。第一篇论文《注意力机制Transformer的可控研究》(A Controlled Study of Attention-Only Transformers)研究了前馈层是否必不可少,发现虽然移除它们会带来性能损失,但将参数重新分配给注意力深度可以在很大程度上弥补这一不足。第二篇论文《相关与不相关:Transformer注意力的重整化群分…
-
深度循环Transformer展示每Token固定点收敛
研究人员调查了深度循环Transformer的内部计算,特别是每个Token的状态如何在多个处理循环中演变。他们发现,每个Token的状态会收敛到一个固定点,尽管这种收敛并不均匀。虽然中位数Token在第六个循环时稳定下来,但大约10%的Token在典型的八个训练循环深度下仍在更新。这种每Token的变化至关重要,因为一旦Token的输出稳定就停止处理,可以在不牺牲质量的情况下显著降低计算深度。
-
新研究详述在单 GPU 上训练的小型语言模型
研究人员详细介绍了一种使用显著更少计算资源(具体来说是在单个 NVIDIA L20 GPU 上)训练小型语言模型 L20-Edu-135M 的方法。该研究侧重于数据效率,预训练使用了约 130 亿个 token,这仅占同类模型通常使用的 token 数量的一小部分。虽然所得模型并未超越 SmolLM-135M 等现有的最先进的小型模型,但其性能优于较旧的公开基线模型,并为资源受限的语言模型开发提供了一个可审计的案例研究。
-
新的预训练方法通过集成反思增强了LLM的安全性
研究人员引入了一种名为安全反思预训练的新方法,旨在增强大型语言模型(LLM)在预训练阶段的安全对齐。该方法通过将定期的安全反思纳入预训练语料库,超越了简单的过滤或重写不安全数据。在FineWeb-Edu数据集上对1.7B模型进行的实验表明,安全分类准确性有所提高,并且对攻击的敏感性降低。还开发了一个名为MedSafetyWorld的合成环境,以进一步验证该方法在防止模型从安全数据泛化不安全行为方面的有效性。
-
EverydayGPT 使用置信度门控将 RAG 延迟降低 120 倍
研究人员开发了 EverydayGPT,一个对话式问答系统,它使用置信度门控路由 (CGR) 机制来提高效率。该系统根据检索距离和提取充分性路由查询,避免了大多数请求昂贵的 GPT 路径。EverydayGPT 在 85% 的查询中实现了 120 倍的延迟降低,同时保持了答案质量,展示了在准确性略有提高的情况下显著的效率提升。
-
SoftMatcha 2 使万亿级 token 搜索速度提升至 0.3 秒以内
研究人员开发了 SoftMatcha 2,这是一种新颖的算法,旨在对海量文本数据集进行快速、语义灵活的模式匹配。该系统可以在一秒钟内搜索万亿个 token,并能处理查询中的变体,如替换、插入和删除。它通过动态语料库感知剪枝和面向磁盘的设计来实现效率,在大语料库上性能优于现有方法,并证明了其在识别基准污染和增强信息检索方面的实用性。
-
面向儿童的语音有助于AI语言生成,而非理解
一篇新研究论文探讨了面向儿童的语音(CDS)如何影响语言模型,特别是侧重于生成能力而非仅仅是理解能力。研究发现,在CDS上训练的模型在语法完成和槽填充集中表现出更早的迹象,这表明CDS有助于语言生成。这与理解基准形成对比,后者可能低估了CDS对AI语言习得的好处。
-
Kronecker Embeddings 削减语言模型参数,提升性能
研究人员开发了 Kronecker Embeddings,一种表示语言模型中标记的新颖方法,可显著减少可训练参数的数量。该方法用固定的编码器和学习到的投影替换大型嵌入表,将参数数量减少了 91-94%。实验表明,与传统的 BPE 绑定嵌入相比,Kronecker Embeddings 可带来更低的验证损失和更快的收敛速度,同时还能提高对拼写错误的鲁棒性,并通过生成保留字节级信息。
-
新的跨域注意力机制融合了Transformer和SSM
研究人员推出了一种名为跨域注意力(Interdomain Attention)的新型机制,它融合了Transformer和深度状态空间模型(SSM)的优势。该新方法使用核方法将SSM集成到注意力模块中,通过特征图近似注意力核,并将键特征投影到由SSM递归管理的共享基函数集上。在FineWeb-Edu上的语言模型实验中,跨域注意力在SSM和softmax基线之上展现了改进的性能,尤其是在更大的规模和更长的上下文长度下。
-
Muown 优化器通过控制行范数漂移来改进 LLM 训练
研究人员开发了 Muown,这是一种旨在改进大型语言模型训练的新型优化方法。Muown 解决了 Muon 优化器的问题,特别是训练过程中权重矩阵中谱范数的向上漂移。通过将行幅度向量视为显式变量,Muown 提高了各种模型规模下的困惑度和学习率稳定性,性能优于 AdamW 和 Lion 等现有优化器。