PulseAugur
中
实时 11:19:45
实体 Group Relative Policy Optimization

Group Relative Policy Optimization

PulseAugur coverage of Group Relative Policy Optimization — every cluster mentioning Group Relative Policy Optimization across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
161
90 天内 161
发布 · 30天
0
90 天内 0
论文 · 30天
159
90 天内 159
层级分布 · 90 天
主题
关系
时间线
  1. 2026-06-16 research_milestone A research paper details the application of Group Relative Policy Optimization to enhance LLM event forecasting. 来源
情绪 · 30 天

11 天有情绪数据

最近 · 第 1/9 页 · 共 168 条
  1. TOOL · CL_284619 ·

    AI模型评估指标pass@k因多样性和能力保留问题受到质疑

    一项新的研究论文质疑了pass@k指标在评估AI模型方面的有效性,特别是在训练后微调之后。研究表明,虽然pass@k可能显示出边际改进,但它未能捕捉到输出多样性和能力保留等关键方面。使用Qwen2.5-1.5B-Instruct模型在数学问题上的实验显示,不同的微调方法导致多样性度量出现相反的趋势,但pass@k指标在硬问题覆盖率方面并未显示出明显的赢家或显著改进。该论文认为,pass@k可能具有误导性,尤其是在评估正确答案的多样性时…

  2. TOOL · CL_284501 ·

    新的DMAST方法增强了多模态网络代理抵御跨模态攻击的能力

    研究人员开发了一种名为双模态多阶段对抗性安全训练(DMAST)的新方法,以提高多模态网络代理抵御复杂攻击的鲁棒性。这些代理能够处理来自网络界面的视觉和文本信息,容易受到跨模态攻击,即操纵内容同时影响两个观察通道。DMAST将这种交互形式化为一个博弈,并采用了一个三阶段的训练流程:模仿学习、Oracle引导的微调和对抗性强化学习。这种方法显著降低了攻击成功率,同时提高了在分布外任务上的完成度,优于现有防御措施。

  3. TOOL · CL_282204 ·

    新SCOUT框架改进旅行搜索查询建议

    研究人员开发了SCOUT,一个旨在改进旅行搜索引擎中主动查询建议的新框架。与通用搜索不同,旅行搜索受到可用库存的限制,而传统的基于LLM的建议方法由于缺乏历史用户数据和自由文本查询而难以解决冷启动问题。SCOUT通过利用供应方系统反馈,特别是搜索引擎重排器提供的查询-列表匹配分数,来训练强化学习策略,从而解决这一问题。这种方法在不增加推理成本的情况下提高了库存匹配率和多样性,使得供应感知建议在实时旅行搜索中变得可行。

  4. TOOL · CL_277350 ·

    新研究解释GRPO归一化在自适应梯度中的作用

    一篇新研究论文探讨了组相对策略优化(GRPO)中归一化的必要性和有效性。GRPO是语言模型强化学习的标准算法。该研究发表在arXiv上,理论上证明了GRPO的归一化充当自适应梯度,提高了比标准REINFORCE方法更快的收敛速度。研究人员还引入了重要性采样变体IS-GRPO,并在GSM8K和MATH数据集上进行了实证验证,尤其是在每提示方差异构的情况下,显示出性能提升。

  5. RESEARCH · CL_280566 ·

    FlowHMR框架从视频生成物理上可行的3D人体运动

    研究人员开发了FlowHMR,一个从单目视频生成物理上可行的3D人体运动的新框架。该方法通过将运动捕捉构建为视频条件生成问题来解决先前方法的局限性,并使用组相对策略优化(GRPO)进行增强。FlowHMR使用保真度和跟踪奖励来确保运动与输入视频一致,并且能够被基于物理的控制器成功跟踪。在新Wild-4K数据集上的实验表明,FlowHMR的性能显著优于现有方法,物理跟踪成功率达到82.47%,而最强的基线GVHMR为62.82%。

  6. RESEARCH · CL_268951 ·

    新的RL方法改进LLM代理和多代理系统的信用分配 · 跟踪9个来源

    多篇研究论文介绍了用于改进代理和多代理系统强化学习(RL)中信用分配的新方法。这些方法旨在更准确地将结果归因于特定决策或行动,尤其是在涉及大型语言模型(LLM)或协作多代理控制的复杂场景中。技术包括可验证可行性表示、分段重加权、近端熵、半事实稳定性以及空间信用分配,在各种基准测试中通常优于现有基线。

  7. TOOL · CL_268867 ·

    新的3D视觉语言模型增强CT扫描分析

    研究人员开发了NV-Reason-CT,这是一种新颖的3D视觉语言模型,用于分析胸部和腹部CT扫描。该模型集成了3D视觉Transformer和语言模型,在整个分析过程中保留了详细的空间信息。NV-Reason-CT在大量多模态指令和放射科专家推理数据集上进行训练,能够对异常进行分类、生成报告并进行交互式推理,有望缩短解读时间。

  8. TOOL · CL_268812 ·

    医学 VLM 审计揭示准确性与视觉效用之间的差距

    一篇新发表在 arXiv 上的研究论文详细介绍了一项对医学视觉语言模型(VLMs)及其训练后评估方法的受控审计。该研究聚焦于 Qwen2.5-VL-3B 模型,并比较了不同的训练后技术,包括监督微调(SFT)和低秩适配(LoRA),以及诸如 Group Relative Policy Optimization(GRPO)等标准方法。研究结果表明,尽管准确性指标可能有所提高,但某些训练后方法可能会无意中降低视觉受益事件和图像敏感性,这表…

  9. RESEARCH · CL_271168 ·

    新的CorrGRPO方法增强了语言模型的多元奖励学习

    研究人员推出了一种名为相关性归一化GRPO(CorrGRPO)的新方法,用于训练具有多个奖励信号的推理语言模型。这种新方法解决了标准组相对策略优化(GRPO)中大规模奖励可能掩盖较小奖励的局限性。CorrGRPO将成对协方差归一化为皮尔逊相关系数,确保不同奖励成分的影响更加均衡。该方法已在0.5B到8B参数的模型上,在代码生成、工具调用和代理安全任务中展现出改进。

  10. RESEARCH · CL_270903 ·

    新的VLM框架LensVLM和FocusVTC改进了视觉文本压缩

    研究人员开发了两个新框架LensVLM和FocusVTC,以改进视觉语言模型(VLM)处理长文档的方式,方法是压缩视觉文本表示。LensVLM使用训练后方法选择性地扩展相关文本的压缩图像,在保持准确性的同时实现了显著压缩。FocusVTC采用自适应分辨率,结合低DPI全局视图和选择性区域增强,并在各种基准测试中展示了改进的性能,甚至在某些任务上超越了其文本输入骨干。

  11. TOOL · CL_274559 ·

    评分标准反应理论通过项目反应建模增强RL奖励

    研究人员引入了评分标准反应理论(RRT),这是一种在需要人类判断的强化学习任务中生成奖励的新颖方法。与对评分标准项求和的传统方法不同,RRT采用双参数项目反应模型,从判断模式中推断出标量质量分数。该方法以Qwen3.5-4B模型为证,在各种数据集上,尤其是在医学和科学领域,显示出优于Group Relative Policy Optimization (GRPO)的性能。RRT还通过自适应Fisher选择减少了所需的判断次数,从而提高了效率。

  12. RESEARCH · CL_267137 ·

    AI 研究在数学、适应性和公平性方面推进强化学习 · 跟踪 10 个来源

    研究人员正在探索先进的强化学习技术,以提高 AI 的数学推理和适应能力。一篇论文介绍了函数结构图强化学习 (FSG-RL),通过从函数图生成代码并使用多验证器反馈来增强数学问题解决能力,显著提高了准确性。其他研究侧重于通过样本重用来优化近端策略优化 (PPO),并探索用于测试时适应的无数据方法。此外,还在开发无监督强化学习、具有神经进化的持续学习以及将公平性与 AI 系统的可解释性相结合的新方法。

  13. RESEARCH · CL_267089 ·

    AI研究揭示观察保真度、意识和推理可靠性方面的反直觉发现

    新研究表明,提高观察保真度会适得其反地损害具身大型语言模型(LLM)的解决问题能力,一项研究发现原始RGB输入比完美的地面真实数据更有效。另一篇论文探讨了一个评估AI意识的框架,表明意识的指标与通用智能所需的特征重叠。此外,关于LLM推理的研究表明,虽然强化学习可以提高性能,但它也可能导致“长度分配不当”,即模型在简单任务上花费过多时间,而在复杂任务上花费时间不足,并且启用“推理模式”有时会使模型更容易出错。

  14. RESEARCH · CL_259504 ·

    VibeAvatar系统解耦语音与美学,实现高保真语音化身

    研究人员开发了VibeAvatar,一个从肖像和语音生成高保真语音化身的新系统。与先前隐式学习唇部发音和动作美学的方法不同,VibeAvatar将这些目标解耦。它使用语音运动学适配器将语音特征转换为语音-运动学条件,并使用美学运动策略来优化运动美学。这种方法可以在不到10秒的时间内,以最小的VRAM生成10秒的512px视频。

  15. RESEARCH · CL_259495 ·

    SVMemAgent 解决了流式视频的在线帧选择问题

    研究人员开发了SVMemAgent,一个专为流式视频场景中的在线帧选择而设计的新型系统。与需要预先访问完整视频和查询的传统方法不同,SVMemAgent实时运行,维护一个先前观察到的内容的动态内存。该代理使用基于任务奖励的组相对策略优化进行训练,以决定保留或丢弃传入帧,即使没有特定查询也能确保捕获普遍有用的帧。实验表明,SVMemAgent优于现有的在线选择方法,并且与离线方法相当。

  16. TOOL · CL_258595 ·

    Apple 研究人员发布 DACA-GRPO 以改进扩散语言模型

    Apple 机器学习研究部推出 DACA-GRPO,一种用于增强扩散语言模型强化学习的新颖方法。该方法通过结合时间信用分配和减少似然估计中的偏差来解决现有强化学习技术的局限性。DACA-GRPO 在包括数学推理、代码生成和约束满足在内的各种基准测试中取得了显著的性能提升。

  17. RESEARCH · CL_254359 ·

    AI公平性基准被批评过于简单化,提出新的基于效用的方法

    新研究表明,当前大型语言模型的公平性基准,如BBQ,可能过于简单化。一项研究表明,在BBQ基准上训练像Qwen 2.5 7B Base这样的模型,或使用它进行一次性上下文学习,可以显著提高其准确性。这表明模型可以通过利用结构线索来通过这些基准,而不是实现真正的公平性。另一篇论文提出了一个基于效用的框架来评估公平性,认为仅靠概率指标可能会产生误导,并且不能反映决策的实际后果,正如在大学招生和信用风险评估中的例子所说明的那样。

  18. TOOL · CL_254339 ·

    Open-UniMo 通过共享标记空间推进统一运动-语言 AI

    研究人员推出 Open-UniMo,这是一种新颖的大型运动-语言模型 (LMLM),专为开放世界环境中的统一运动生成和理解而设计。该模型通过共享标记空间促进模态对等,扩展了 Qwen 的词汇量以包含运动标记,从而解决了现有以文本为主导的方法的局限性。Open-UniMo 结合了运动一致的思维链推理和两阶段训练流程,包括群组相对策略优化,以提高语义对齐并减轻生成错误。为了便于评估,该团队还开发了 Open-MoBench,这是一个用于评…

  19. TOOL · CL_252241 ·

    新方法平衡文本到图像生成中的情感与语义

    研究人员开发了一种新的文本到图像生成情感控制方法,旨在提高情感一致性,同时不改变图像的核心语义内容。该方法结合了流匹配框架、组相对策略优化(GRPO)和一个中性语义锚点,以防止情感-语义漂移。实验表明,与现有技术相比,该方法在 Valence 和 Arousal 误差方面表现更低,CLIPScore 也有所提高,但参考图像质量略有下降。

  20. TOOL · CL_245161 ·

    新的 GRPO 方法在无需人类标签的情况下训练 NLI 模型

    研究人员开发了一种使用群体相对策略优化 (GRPO)(一种强化学习方法)来训练自然语言推断 (NLI) 模型的新方法。该技术消除了对人类标注理由的需求,允许在 ANLI 等具有挑战性的数据集上训练模型。当使用 LoRA 和 QLoRA 等参数高效方法应用于 7B、14B 和 32B 语言模型时,GRPO 训练的模型在标准和对抗性 NLI 基准测试中表现出强大的性能。值得注意的是,32B 模型在对抗性数据集上的泛化能力优于监督基线,并且…