PulseAugur
中
实时 00:36:23
实体 Group Relative Policy Optimisation

Group Relative Policy Optimisation

PulseAugur coverage of Group Relative Policy Optimisation — every cluster mentioning Group Relative Policy Optimisation across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_228964 ·

    新的 LLM 训练和推理策略提升 Manim 动画生成效果

    研究人员开发了一种名为 ManimTrainer 的新颖训练流程,该流程结合了监督微调 (SFT) 和诸如 Group Relative Policy Optimisation (GRPO) 等强化学习 (RL) 技术。该方法旨在改进使用像 Manim 这样的库的大型语言模型 (LLM) 生成程序化动画。该研究还引入了 ManimAgent,一种利用 Renderer-in-the-loop (RITL) 和 API 文档增强的 RI…

  2. TOOL · CL_128824 ·

    新ASIG方法通过贝叶斯设计增强LLM的信息收集能力

    研究人员开发了一种名为Amortised Sequential Information Gathering (ASIG) 的新微调方法,以改进大型语言模型(LLM)在顺序决策场景中收集信息的方式。ASIG将贝叶斯实验设计(BED)集成到LLM策略中,增强了它们提出有效问题的能力。在20个问题任务上进行测试时,与现有方法相比,ASIG显著提高了成功率并降低了推理成本。该方法在将学习到的信息搜寻策略转移到新领域(如医学诊断)方面也显示出潜力。