PulseAugur
实时 10:25:05
实体 Reinforcement Fine-Tuning

Reinforcement Fine-Tuning

PulseAugur coverage of Reinforcement Fine-Tuning — every cluster mentioning Reinforcement Fine-Tuning across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 3
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 4 条
  1. TOOL · CL_196014 ·

    新的CARE框架提升了医学VQA模型的可靠性和可信度

    研究人员开发了CARE,一个旨在提高医学视觉问答(VQA)模型可靠性的框架。CARE解决了置信度失校准问题,即模型表达的确定性与其诊断准确性不符。该框架采用两阶段流程,包括使用合成的医学思维链数据进行监督微调,以及在组相对策略优化中引入新颖的置信度感知奖励机制,以更好地使置信度与正确性保持一致。在三个医学VQA基准上的评估表明,CARE在提高诊断准确性的同时,降低了校准误差和幻觉率,为更值得信赖的临床决策支持工具铺平了道路。

  2. RESEARCH · CL_191188 ·

    新框架将推荐基础模型与业务指标对齐 · 跟踪 2 个来源

    研究人员开发了一种新颖的三阶段后训练框架,以更好地将推荐基础模型与业务指标对齐。这种渐进式方法将下游适应(使用线性探测和完全微调)与通过带有学习奖励模型的强化微调进行的业务指标对齐分开。实验表明,这种多阶段方法优于单阶段替代方案,并在大规模在线测试中提高了推荐质量。

  3. TOOL · CL_143494 ·

    30个提示词可将AI微调至最优储能控制

    研究人员展示了仅使用30个特定提示词即可显著优化一个开源AI模型在储能控制方面的表现。根据一项预印本研究,这种微调方法将该模型的建筑排放量降至61.2千克二氧化碳,非常接近60.8千克二氧化碳的最优目标。

  4. RESEARCH · CL_143338 ·

    新的RLVR方法微调推理模型用于能源存储控制

    研究人员开发了一种名为基于验证器的强化微调(RLVR)的新颖方法,用于将开放权重推理模型适配到热能存储控制等复杂任务中。该技术使用动态规划生成可验证的奖励,然后用于微调GPT-5等模型。研究表明,RLVR在模拟办公楼的热能存储系统中显著减少了排放,使性能接近最优水平。研究结果表明,推理时的推理能力对于此类控制任务至关重要,而RLVR方法有望在能源管理领域得到更广泛的应用。