实体
Decoupled Clip and Dynamic Sampling Policy Optimization
Decoupled Clip and Dynamic Sampling Policy Optimization
PulseAugur coverage of Decoupled Clip and Dynamic Sampling Policy Optimization — every cluster mentioning Decoupled Clip and Dynamic Sampling Policy Optimization across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
VideoScout 代理学习自适应节奏以理解长视频
研究人员推出 VideoScout,这是一种采用顺序证据获取 (SEA) 范式来理解长视频的代理。该方法使代理能够调整其观看节奏、保留关键证据、重新访问不确定的片段,并有效地确定何时回答。VideoScout-66K 是一个包含超过 66,000 个探索回合的数据集,用于通过涉及监督微调和具有复合奖励的轨迹级强化学习的两阶段流程来训练代理。
-
新恒等式统一三种语言模型训练方法
一篇新论文介绍了分组标准差恒等式(Group-Standard-Deviation Identity),证明了三种流行的语言模型训练方法——GRPO、Dr. GRPO 和 DAPO——本质上是对单个参数的调整:采样答案分歧的标准差。该恒等式揭示了标准差直接与训练更新的大小相关,一致同意不产生学习,而答案分歧则提供最重要的训练信号。研究通过 Big-Math 数据集和受控训练运行验证了这些发现,强调了该参数在决定学习效果和重点方面的关键作用。