PulseAugur
中
实时 23:12:21
实体 GRPODropout

GRPODropout

PulseAugur coverage of GRPODropout — every cluster mentioning GRPODropout across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_290347 ·

    LLM 后训练技术通过新的蒸馏和优化方法取得进展

    LLM 后训练技术近期取得了进展,重点关注参数高效微调、偏好优化和蒸馏。DIAL-OPD 等新方法在蒸馏中展示了从更少 token 中学习能力的提高,而 LSC-DPO 则为直接偏好优化提供了一种学习信号控制的方法。此外,对 Group Policy Optimization (GRPO) 的研究已识别出故障模式并提出了解决方案,GRPO 也被应用于生产 OCR 任务。

  2. RESEARCH · CL_267137 ·

    新研究探索先进的强化学习技术和智能体框架 · 已追踪 10 个来源

    arXiv 上发布的几篇研究论文介绍了用于推进强化学习 (RL) 和智能体 AI 的新颖框架和技术。AgentFly 提出了一个统一的资源系统,通过将环境视为可调度资源来扩展智能体 RL。MA-JEPA 探索了多智能体 RL 的联合嵌入世界模型,在 SMAC 基准测试中表现强劲。其他论文介绍了用于分层 RL 的 Q-Shaped Options,用于通过选择性移除样本来改进在线 RL rollout 的 GRPODropout,以及使…