研究人员开发了MADA-RL,一个新颖的训练后框架,旨在利用参数高效的方法增强紧凑型语言模型(40亿参数以下)的推理能力。该框架使用独特的辩论感知学习信号来训练专门的生成器和评估器模型,仅通过LoRA适配器微调一小部分参数。MADA-RL在DeepSeek-R1-Distill-Qwen-1.5B模型的数学推理基准测试中展示了2.0个百分点的准确率提升,并且与完全微调相比,可训练参数数量显著减少。 AI
影响 这项研究提供了一种参数高效的方法来改进小型语言模型的推理能力,有望降低训练成本,并使更高级的功能更加易于获取。
排序理由 该集群包含一篇arXiv论文,详细介绍了一种用于改进语言模型推理能力的新研究方法。
在 arXiv cs.MA (Multiagent) 阅读 →
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →