实体
Reinforcement Learning from Internal Feedback
Reinforcement Learning from Internal Feedback
PulseAugur coverage of Reinforcement Learning from Internal Feedback — every cluster mentioning Reinforcement Learning from Internal Feedback across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
时间线
- 2026-05-21 research_milestone A new multi-reward RLIF framework is proposed to improve LLM reasoning. 来源
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
新框架用更少数据提高LLM置信度忠实度
一篇新研究论文提出了一个名为HyTuning的框架,旨在提高大型语言模型置信度的忠实度,特别适用于高风险应用。该方法通过使用渐进推理增益(Progressive Reasoning Gain)指标来确保推理步骤逐步增强置信度,从而解决了训练数据有限和过度自信等挑战。HyTuning自适应地重新加权内部反馈强化学习(Reinforcement Learning from Internal Feedback)和推理蒸馏(Reasoning…
-
新的RLIF框架使用多奖励信号来改进LLM推理
研究人员开发了一种使用内部反馈强化学习(RLIF)训练大型语言模型的新框架。这种多奖励方法将训练信号分解为来自集群投票的答案级奖励和基于代币自我确定性的完成级奖励。该方法结合了基于GDPO的归一化和KL-Cov正则化,以增强稳定性和防止崩溃,在没有外部真实监督的情况下实现了接近监督方法的性能。