PulseAugur
实时 21:05:18
English(EN) MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models

新的MADA-RL框架通过参数高效的辩论学习提升紧凑模型的推理能力

研究人员开发了MADA-RL,一个新颖的训练后框架,旨在利用参数高效的方法增强紧凑型语言模型(40亿参数以下)的推理能力。该框架使用独特的辩论感知学习信号来训练专门的生成器和评估器模型,仅通过LoRA适配器微调一小部分参数。MADA-RL在DeepSeek-R1-Distill-Qwen-1.5B模型的数学推理基准测试中展示了2.0个百分点的准确率提升,并且与完全微调相比,可训练参数数量显著减少。 AI

影响 这项研究提供了一种参数高效的方法来改进小型语言模型的推理能力,有望降低训练成本,并使更高级的功能更加易于获取。

排序理由 该集群包含一篇arXiv论文,详细介绍了一种用于改进语言模型推理能力的新研究方法。

在 arXiv cs.MA (Multiagent) 阅读 →

AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →

新的MADA-RL框架通过参数高效的辩论学习提升紧凑模型的推理能力

报道来源 [3]

  1. arXiv cs.AI TIER_1 English(EN) · Martino M. L. Pulici, Cuong Xuan Chu, Evgeny Kharlamov, Zifeng Ding, Volker Tresp, Yunpu Ma ·

    MADA-RL:用于紧凑模型中参数高效推理的多智能体辩论感知强化学习

    arXiv:2607.18006v1 Announce Type: cross Abstract: Large language models achieve strong reasoning performance, but often at prohibitive training cost - a challenge that is especially acute for compact models ($\leq 4 \, \mathrm{B}$ parameters) trained under limited budgets. We int…

  2. arXiv cs.MA (Multiagent) TIER_1 English(EN) · Yunpu Ma ·

    MADA-RL:用于紧凑模型中参数高效推理的多智能体辩论感知强化学习

    Large language models achieve strong reasoning performance, but often at prohibitive training cost - a challenge that is especially acute for compact models ($\leq 4 \, \mathrm{B}$ parameters) trained under limited budgets. We introduce MADA-RL, a post-training framework that spe…

  3. Hugging Face Daily Papers TIER_1 English(EN) ·

    MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models

    Large language models achieve strong reasoning performance, but often at prohibitive training cost - a challenge that is especially acute for compact models ($\leq 4 \, \mathrm{B}$ parameters) trained under limited budgets. We introduce MADA-RL, a post-training framework that spe…