PulseAugur
中
实时 00:05:04
English(EN) Stepwise Intrinsic Rewards for Reasoning in Large Language Models

新方法通过内在奖励增强 LLM 推理能力

研究人员开发了一种名为分步边际信息增益(MIG)的新方法,以提高大型语言模型(LLM)和视觉语言模型(VLM)的推理能力。MIG 根据推理过程的每一步如何增加正确答案的可能性来计算内在奖励,提供比传统稀疏二元奖励更精细的反馈机制。该方法在各种基准测试中均显示出显著的改进,其性能优于仅基于结果的奖励,甚至在某些视觉语言任务中超越了外部过程奖励模型(PRM),而无需额外的推理时间处理。 AI

影响 这种新的内在奖励方法可以更有效地训练 LLM 和 VLM,在无需大量手动标注的情况下提高它们的推理能力。

排序理由 该集群描述了一种在学术论文中发布的新方法,用于改进 LLM 推理能力。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新方法通过内在奖励增强 LLM 推理能力

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Xiangwei Wang, Wei Wang, Ken Chen, Nanduni Nimalsiri, Sachith Seneviratne, Saman Halgamuge ·

    大型语言模型推理中的分步内在奖励

    arXiv:2602.01034v2 Announce Type: replace Abstract: Reinforcement learning (RL) has become a widely used paradigm for improving the reasoning abilities of large language models (LLMs) and Vision-language models (VLMs). Sparse binary outcome rewards, however, score only final corr…