研究人员推出了一种名为动态重要示例挖掘(DIEM)的新型框架,旨在增强大型语言模型(LLM)的强化微调(RFT)。DIEM通过估计每个样本对策略改进的边际贡献,在RFT过程中自适应地选择和重新加权训练数据。该方法旨在克服静态数据选择方法的局限性,因为静态数据选择方法可能由于策略学习的非平稳性而导致模型更新不理想。DIEM集成了梯度对齐重要性估计器和约束批次重加权方案,以稳定优化并最大化效用,在推理基准测试中表现出持续的优越性。 AI
影响 这种自适应数据选择方法可能导致LLM在复杂推理任务上的微调更有效率和更有效。
排序理由 该集群描述了一篇详细介绍改进LLM微调新方法的最新研究论文。
在 Hugging Face Daily Papers 阅读 →
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Diem
- Gotit.pub
- Hugging Face
- Large Language Models
- Reinforcement Finetuning
- ScienceCast
- constrained batch reweighting scheme
- gradient-alignment importance estimator
- large models
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →