研究人员推出OptiSelect,一个用于优化大型语言模型预训练期间数据选择的新框架。该框架将优化器感知选择的概念形式化,该概念考虑了优化器步骤如何影响数据候选者的价值。理论分析表明,与Lion和Muon等基于符号或极性切线的预条件器相比,AdamW和Sophia等对角自适应优化器在此选择过程中更有效。使用124M和720M模型的实验结果支持了这些发现,表明即使使用Muon作为优化器,AdamW的评分几何形状也表现最佳。 AI
影响 为LLM预训练中优化器和数据选择的协同设计提供了理论基础和实践指导。
排序理由 该集群包含一篇详细介绍用于优化LLM预训练的新框架和理论分析的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →