研究人员开发了一种使用群体相对策略优化 (GRPO)(一种强化学习方法)来训练自然语言推断 (NLI) 模型的新方法。该技术消除了对人类标注理由的需求,允许在 ANLI 等具有挑战性的数据集上训练模型。当使用 LoRA 和 QLoRA 等参数高效方法应用于 7B、14B 和 32B 语言模型时,GRPO 训练的模型在标准和对抗性 NLI 基准测试中表现出强大的性能。值得注意的是,32B 模型在对抗性数据集上的泛化能力优于监督基线,并且通过 AWQ 量化,它可以在 22GB 的 CUDA 内存中运行。 AI
影响 这项研究提供了一种更具可扩展性和效率的训练鲁棒 NLI 模型的方法,有望改进事实核查和信息检索等应用。
排序理由 该集群包含一篇详细介绍 NLI 模型新训练方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Chain-of-Thought
- CUDA
- Group Relative Policy Optimization
- GRPO
- Hugging Face
- LoRA
- QLoRA
- Natural Language Inference
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →