研究人员开发了通过先进数据调度技术优化大语言模型(LLM)训练的新方法。一种方法是整体数据调度器(HDS),它使用多目标强化学习在预训练期间动态调整数据混合,从而在 The Pile 和 MMLU 等基准测试中显著提高训练效率和模型性能。另一种方法是自适应数据调度(ADS),它通过从统一数据采样转向语义集群和策略边界样本的自适应分布,专注于改进训练后强化学习,在推理基准测试中显示出优势。此外,一种使用精选数据集和最小 GRPO 设置的数据中心方法在 LLM 的长上下文推理方面取得了显著改进,优于先前的强化学习方法。 AI
影响 这些数据调度和强化学习技术的进步有望加速 LLM 的训练并增强其推理能力,尤其是在长上下文任务方面。
排序理由 多篇研究论文介绍了用于 LLM 训练和强化学习的新颖方法。
在 Hugging Face Daily Papers 阅读 →
- Adaptive Data Scheduling
- Group Relative Policy Optimization
- Grpo
- Large Language Models
- Reinforcement Learning
- BrowseComp
- Qwen3-4B/8B/30B-A3B
- Holistic Data Scheduler
- Massive Multitask Language Understanding
- Online Data Mixing
- Soft Actor-Critic
- The Pile
AI 生成摘要 · Google Gemini · 来自 5 个来源。 我们如何撰写摘要 →