PulseAugur
实时 07:30:40

新的UP目标通过平衡探索与稳定性来增强LLM推理能力

研究人员推出了一种名为“无界正向非对称优化”(Unbounded Positive Asymmetric Optimization, UP)的新型目标函数,旨在改进大型语言模型(LLMs)的强化学习(RL)。UP通过允许正向优势的梯度无限制,从而增强探索,同时保持对负向优势的梯度裁剪,以防止训练不稳定,从而解决了当前RL框架中固有的探索-稳定性困境。这种即插即用的目标函数已在各种RL算法、模型架构和训练模式中展现出提高推理准确性的能力。 AI

影响 这一新的优化目标通过在强化学习中增强探索能力,从而提高LLM的推理能力,可能带来更稳定、更强大的LLM。

排序理由 该集群描述了一篇关于LLM强化学习新优化目标的新研究论文。

在 Hugging Face Daily Papers 阅读 →

AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →

新的UP目标通过平衡探索与稳定性来增强LLM推理能力

报道来源 [2]

  1. arXiv cs.LG TIER_1 English(EN) · Chongyu Fan, Pengfei Liu, Jingjia Huang, Sijia Liu, Yi Lin ·

    UP:无界正向不对称优化,以打破探索-稳定性困境

    arXiv:2607.06987v1 Announce Type: new Abstract: Reinforcement learning (RL) has become the standard paradigm for enhancing the complex reasoning capabilities of large language models (LLMs). To achieve sample efficiency, modern RL frameworks rely on importance sampling (IS). Howe…

  2. Hugging Face Daily Papers TIER_1 English(EN) ·

    UP:无界正向非对称优化,打破探索-稳定性困境

    Reinforcement learning frameworks for large language models face exploration-stability trade-offs, which are addressed through a novel universal objective called Unbounded Positive Asymmetric Optimization that enables stable training with enhanced exploration capabilities.