PulseAugur
实时 13:43:10
English(EN) Beyond Reward Engineering: A Data Recipe for Long-Context Reinforcement Learning

新的大语言模型训练方法优化数据调度以提高效率和性能

研究人员开发了通过先进数据调度技术优化大语言模型(LLM)训练的新方法。一种方法是整体数据调度器(HDS),它使用多目标强化学习在预训练期间动态调整数据混合,从而在 The Pile 和 MMLU 等基准测试中显著提高训练效率和模型性能。另一种方法是自适应数据调度(ADS),它通过从统一数据采样转向语义集群和策略边界样本的自适应分布,专注于改进训练后强化学习,在推理基准测试中显示出优势。此外,一种使用精选数据集和最小 GRPO 设置的数据中心方法在 LLM 的长上下文推理方面取得了显著改进,优于先前的强化学习方法。 AI

影响 这些数据调度和强化学习技术的进步有望加速 LLM 的训练并增强其推理能力,尤其是在长上下文任务方面。

排序理由 多篇研究论文介绍了用于 LLM 训练和强化学习的新颖方法。

在 Hugging Face Daily Papers 阅读 →

AI 生成摘要 · Google Gemini · 来自 5 个来源。 我们如何撰写摘要 →

新的大语言模型训练方法优化数据调度以提高效率和性能

报道来源 [5]

  1. arXiv cs.CL TIER_1 English(EN) · Chenhao Dang, Jing Ma, Mingjie Liao ·

    基于多目标强化学习的LLM预训练整体数据调度器

    arXiv:2606.24133v1 Announce Type: cross Abstract: The composition of training data, governed by the diversity of sources and their mixing strategy, is a cornerstone of Large Language Model (LLM) pre-training. Online Data Mixing (ODM), the technique of adaptively adjusting data mi…

  2. arXiv cs.CL TIER_1 English(EN) · Mingjie Liao ·

    基于多目标强化学习的LLM预训练整体数据调度器

    The composition of training data, governed by the diversity of sources and their mixing strategy, is a cornerstone of Large Language Model (LLM) pre-training. Online Data Mixing (ODM), the technique of adaptively adjusting data mixtures during training, has emerged as a promising…

  3. Hugging Face Daily Papers TIER_1 English(EN) ·

    基于多目标强化学习的LLM预训练整体数据调度器

    A novel online data mixing framework called Holistic Data Scheduler uses reinforcement learning with a multi-objective reward function to optimize large language model pre-training efficiency and performance.

  4. arXiv cs.CL TIER_1 English(EN) · Vladimir Braverman ·

    以合适的节奏学习:自适应数据调度改进LLM强化学习

    Large Language Models (LLMs) achieve remarkable reasoning capabilities through reinforcement learning (RL) post-training. However, existing RL post-training commonly relies on uniform data sampling, which ignores the semantic structure of the training data and the changing capabi…

  5. Hugging Face Daily Papers TIER_1 English(EN) ·

    超越奖励工程:长上下文强化学习的数据配方

    Data-centric approach using curated datasets and minimal GRPO setup significantly improves long-context reasoning in large language models, outperforming prior reinforcement learning methods.