PulseAugur
实时 06:09:45
实体 Dong Shu

Dong Shu

PulseAugur coverage of Dong Shu — every cluster mentioning Dong Shu across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_219144 ·

    新的 I-PPO 方法通过过滤噪声数据改进 LLM 训练

    研究人员开发了影响引导 PPO (I-PPO),这是一个旨在提高大型语言模型 (LLM) 后训练强化学习 (RL) 效率和有效性的新框架。与使用整个 rollout buffers 的传统 PPO 方法不同,I-PPO 使用数据归因技术识别并过滤掉益处较少或噪声较多的 episodes。这种方法充当了内在的提前停止机制,加速了训练并减少了不忠实的推理,实验证明其优于标准的监督微调和 PPO 基线。