研究人员开发了一个名为对比弱到强泛化(ConG)的新框架,以改进大型语言模型的训练。ConG 解决了现有弱到强泛化方法中的局限性,这些方法可能受到弱模型中噪声和偏差的阻碍。通过利用隐式奖励和对比解码,ConG 生成了更高质量的样本,从而实现了更可靠的能力转移和更强的鲁棒性。这种方法在各种模型家族中都显示出了一致的改进,为推进 LLM 训练提供了一条有前途的途径。 AI
影响 通过提高样本质量和鲁棒性来增强 LLM 训练,可能加速朝着更强大模型发展的进程。
排序理由 该集群包含两篇详细介绍改进大型语言模型训练新方法的学术论文。
在 Hugging Face Daily Papers 阅读 →
- A100 GPUs
- AIME 2024
- arXiv
- Contrastive decoding
- Contrastive Weak-to-strong Generalization
- Direct On-Policy Distillation
- Houcheng Jiang
- Hugging Face
- Qwen3 1.7B
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →