PulseAugur
实时 09:34:17
实体 Verl

Verl

PulseAugur coverage of Verl — every cluster mentioning Verl across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 5
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 4
层级分布 · 90 天
主题
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/1 页 · 共 6 条
  1. TOOL · CL_254638 ·

    新的强化学习研究揭示了奖励塑造和过滤中的关键缺陷

    一篇新的研究论文强调了群体相对强化学习(RL)方法中的一个关键缺陷,特别是在使用奖励塑造时与“过滤器指标”相关。研究表明,如果过滤机制优先考虑塑造后的训练分数而不是实际任务结果,就可能导致“幻影优势”。这是因为那些未能完成任务但由于奖励塑造而得分高的群体仍然可以通过过滤器,人为地夸大了它们的可感知性能,并可能误导学习过程。该论文建议使用与塑造无关的任务结果信号进行过滤,以确保更可靠和准确的RL代理训练。

  2. TOOL · CL_235403 ·

    AI模型评估可能因接口审查而产生误导

    一项新的研究论文强调了一种称为“接口诱导的轨迹审查”的现象,即用于评估AI模型的接口可能会错误地报告零工具使用,即使模型正在生成有效的工具调用。在BFCL v4、Qwen2.5-Coder和Llama-3.1-8b等各种模型中都观察到了这个问题,同一个模型仅根据使用的服务适配器就会显示出截然不同的性能指标。该论文指出,这种审查效应与规模有关,并且可能发生在训练循环本身中,从而影响观察到的工具调用率,而工具调用率是模型-接口堆栈的属性,…

  3. TOOL · CL_217886 ·

    新框架简化了 LLM 工具使用代理的 RL 训练

    研究人员开发了 MCP-Universe RL (MCP-U RL),这是一个开源框架,旨在简化利用工具的大型语言模型 (LLM) 代理的训练。该框架解决了两个关键挑战:高效管理大量隔离环境以进行并发训练轨迹,以及在涉及缓慢工具调用的长多轮对话中优化 GPU 利用率。MCP-U RL 与用于环境接口的模型上下文协议 (MCP) 集成,并包含环境和 rollout 管理的编排层,使代理能够在软件工程和深度研究等各种领域进行训练。

  4. TOOL · CL_164069 ·

    Provenir 应对 LLM 训练失败:奖励欺骗、污染、不可复现性

    一个名为 Provenir 的新开源项目旨在解决现代 LLM 训练中三个关键但常常被忽视的失败:奖励欺骗(reward hacking)、评估污染(evaluation contamination)和不可复现性(irreproducibility)。奖励欺骗是指模型学会了满足奖励信号而没有真正推理;评估污染是指基准测试数据泄露到训练集中;不可复现性是指无法复制训练过程。Provenir 提供了诸如飞行记录器、奖励欺骗检测器、污染检查器…

  5. RESEARCH · CL_107782 ·

    新的DigenRL框架通过解耦强化学习加速扩散式生成大语言模型 · 跟踪3个来源

    研究人员开发了DigenRL,一个解耦强化学习框架,旨在提高基于扩散的生成式大语言模型的效率。该新框架通过实现灵活的资源分配和兼容异构GPU来解决现有系统的局限性。DigenRL引入了生成轴流水线(GAP)和时间步长并行(TSP)等新技术,以改进rollout和训练之间的流水线操作,并结合了弹性Trainer-Assisted Generation(TAG)方法。实验表明,DigenRL显著提高了吞吐量,与当前最先进的系统相比,最高可…

  6. TOOL · CL_64743 ·

    开发者详述 verl RL 框架内部原理及 NCCL bug

    一位开发者详细介绍了他在使用 ByteDance 的 verl 框架进行 RL 后训练的经历,包括其内部工作原理以及 fork 该项目的挑战。这篇博文涵盖了框架的编排层、资源管理以及维护 fork 所需的工程开销。它还重点介绍了一个与网络接口选择相关的特定 NCCL bug,该 bug 导致多 GPU 测试挂起。