Verl
PulseAugur coverage of Verl — every cluster mentioning Verl across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
Provenir 应对 LLM 训练失败:奖励欺骗、污染、不可复现性
一个名为 Provenir 的新开源项目旨在解决现代 LLM 训练中三个关键但常常被忽视的失败:奖励欺骗(reward hacking)、评估污染(evaluation contamination)和不可复现性(irreproducibility)。奖励欺骗是指模型学会了满足奖励信号而没有真正推理;评估污染是指基准测试数据泄露到训练集中;不可复现性是指无法复制训练过程。Provenir 提供了诸如飞行记录器、奖励欺骗检测器、污染检查器…
-
新的DigenRL框架通过解耦强化学习加速扩散式生成大语言模型 · 跟踪3个来源
研究人员开发了DigenRL,一个解耦强化学习框架,旨在提高基于扩散的生成式大语言模型的效率。该新框架通过实现灵活的资源分配和兼容异构GPU来解决现有系统的局限性。DigenRL引入了生成轴流水线(GAP)和时间步长并行(TSP)等新技术,以改进rollout和训练之间的流水线操作,并结合了弹性Trainer-Assisted Generation(TAG)方法。实验表明,DigenRL显著提高了吞吐量,与当前最先进的系统相比,最高可…
-
开发者详述 verl RL 框架内部原理及 NCCL bug
一位开发者详细介绍了他在使用 ByteDance 的 verl 框架进行 RL 后训练的经历,包括其内部工作原理以及 fork 该项目的挑战。这篇博文涵盖了框架的编排层、资源管理以及维护 fork 所需的工程开销。它还重点介绍了一个与网络接口选择相关的特定 NCCL bug,该 bug 导致多 GPU 测试挂起。