DeepMath - Deep Sequence Models for Premise Selection
PulseAugur coverage of DeepMath - Deep Sequence Models for Premise Selection — every cluster mentioning DeepMath - Deep Sequence Models for Premise Selection across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
SoftmaxGRPO 增强了复杂提示的强化学习能力
研究人员推出了一种新颖的基于组的强化学习方法 SoftmaxGRPO,旨在改善不同难度提示之间的学习信号分配。与可能对简单提示权重分配不当的现有方法不同,SoftmaxGRPO 使用温度缩放的 softmax advantage 来保持权重有界。该方法已显示出实证改进,将梯度预算从近乎解决的提示中重新分配,并持续优于 GRPO。在评估中,SoftmaxGRPO 在 DeepMath 基准测试上达到了 51.8%,并将指令微调模型在诗歌…
-
Agon 框架使用竞争性 AI 模型对推理进行评分
研究人员推出了一种新颖的竞争性强化学习框架 Agon,旨在提高 AI 模型的推理能力。与仅对最终答案评分的传统方法不同,Agon 将两个模型进行对抗,每个模型通过隐式方式对另一个模型的推理过程进行评分。这种竞争性设置通过面对日益强大的对手,迫使模型发展出更好的思考策略,从而带来显著的性能提升。在 DeepMath 数据集上使用 Qwen3 进行测试时,Agon 的 pass@1 率是标准 GRPO 的两倍,并且比未经训练的 Mixtu…
-
Hugging Face 详细介绍连续批处理和 DeepMath 代理
Hugging Face 发布了介绍两项新 AI 发展的文章。第一篇介绍了连续批处理,一种更有效地处理 AI 模型的技术。第二篇文章重点介绍了 DeepMath,一个由 smolagents 提供支持的轻量级数学推理代理,由英特尔合作开发。
-
Intel 发布 DeepMath,NVIDIA 推出 Cosmos 3 用于物理 AI
Intel 发布了 DeepMath,一个基于 smolagents 框架构建的轻量级数学推理代理。另外,NVIDIA 推出了 Cosmos 3,一个用于物理 AI 推理和行动的开放式全能模型。
-
Intel发布DeepMath轻量级数学推理代理
Intel发布了DeepMath,一个利用smolagents框架的轻量级数学推理代理。该代理旨在高效地执行复杂的数学任务。此次发布被呈现为一篇AI生成的帖子,突显了AI在内容创作中的整合。