PulseAugur
中
实时 00:43:27
实体 OpenMathReasoning

OpenMathReasoning

PulseAugur coverage of OpenMathReasoning — every cluster mentioning OpenMathReasoning across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_280259 ·

    新的Goldilocks RL方法可大幅缩短语言模型推理的训练时间

    研究人员开发了Goldilocks RL,这是一种新颖的自适应数据选择策略,旨在提高强化学习在语言模型推理任务训练中的效率。该方法利用选择器网络来识别对模型当前能力而言既不太容易也不太困难的问题,从而优化学习过程。在OpenMathReasoning和Polaris数据集上的实验表明,Goldilocks RL可以实现与标准GRPO相当的性能,但优化步骤减少多达78%,显著缩短了训练时间和计算资源。

  2. RESEARCH · CL_01012 ·

    为什么英伟达与 Bryan Catanzaro 一起构建开放模型

    英伟达正在显著扩展其开放模型计划,发布更高质量的模型和数据集。该战略通过从开放语言模型中获取价值,为英伟达创造可持续的优势。公司的努力包括 Nemotron 系列,近期发布了 Nemotron 3 Nano 以及即将推出的 Super 和 Ultra 版本,同时还提供了一套全面的训练软件和数据集。