PulseAugur
实时 06:30:56
实体 mathematical reasoning

mathematical reasoning

PulseAugur coverage of mathematical reasoning — every cluster mentioning mathematical reasoning across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
4
90 天内 9
发布 · 30天
0
90 天内 0
论文 · 30天
4
90 天内 9
层级分布 · 90 天
主题
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/1 页 · 共 9 条
  1. TOOL · CL_228622 ·

    新的SHAPE框架解码大语言模型数学推理策略

    研究人员开发了一个名为SHAPE的新框架,用于分析大语言模型(LLMs)在数学任务中的思维链(CoT)推理过程。SHAPE检查模型如何语义化地解释问题以及它们采用的具体数学启发式方法。该框架发现,模型使用的启发式方法比一般的CoT特征更能指示正确答案,并且将推理集中在更少的语义空间内可以带来更好的结果,这与人类行为相似。此外,SHAPE揭示了强化学习会鼓励特定的启发式方法使用,而一种促进多样化启发式方法的训练后方法提高了LLM的准确性。

  2. TOOL · CL_203900 ·

    新的APTER框架通过专家反馈的评估标准增强LLM推理能力

    研究人员开发了APTER,一个旨在增强大型语言模型在专业领域推理能力的新框架。APTER整合了结构化的领域知识,创建了用于评估和优化的自适应的、专家反馈的评估标准。这种方法通过识别和解决数学推理和医学问答等领域的特定缺陷来实现有针对性的微调,从而显著提高性能。

  3. TOOL · CL_196097 ·

    LLM-as-a-Judge框架通过新颖的奖励系统提升AI推理能力

    研究人员开发了一种新颖的半监督学习框架,该框架利用大型语言模型(LLM)作为裁判来将知识蒸馏到AI模型中。该方法采用连续的思维链(CoT)奖励,该奖励由裁判LLM的输出来计算,为未标记数据提供有效的训练信号。该框架在利用地面真实奖励的方法方面,表现出相当或更优的性能,尤其是在未标记数据增加的情况下。将这种基于LLM的奖励与半监督设置中的可验证奖励相结合被证明具有协同作用,在各种任务和模型架构中将数学推理能力提高了5-10%。

  4. RESEARCH · CL_175929 ·

    新的RLSVR方法将LLM的自我改进扩展到开放式任务 · 跟踪 4 个来源

    研究人员开发了具有可验证奖励的强化学习(RLSVR),这是一种新的训练范式,将具有可验证奖励的强化学习(RLVR)的应用扩展到开放式任务。传统的RLVR仅限于数学和编码等易于验证正确性的领域。RLSVR将开放式任务转化为可验证的代理环境,利用SpyRL多智能体游戏等机制生成自动奖励信号。实验表明,这种方法在文本摘要和创意写作等任务上提高了性能,同时在可验证推理任务上也取得了进步。

  5. TOOL · CL_148067 ·

    新的SAR方法从LLM更新中提取紧凑型推理核心

    研究人员开发了子空间对齐重构(SAR),一种新颖的大型语言模型事后编辑方法。SAR识别并分离出强化学习更新中的核心推理组件,这些组件通常集中在模型的谱空间中。通过保留这些基本组件并移除正交的、效果较差的部分,SAR可以在保留超过99%的训练后性能的同时,提高数学推理和代理编码能力。该技术还有助于模型合并和纯化混合域训练,展示了其作为增强LLM性能的无训练机制的潜力。

  6. RESEARCH · CL_115242 ·

    新的SMMD训练方法增强了LLM的数值精度

    研究人员开发了一种名为平滑最大均值差异(SMMD)的新训练目标,以提高大型语言模型(LLM)的数值精度。标准的交叉熵训练将数值标记视为类别,忽略了它们固有的值结构。SMMD通过引入值距离核和基于图的平滑性来解决这个问题,将预测分布与目标值对齐,并鼓励局部一致性。在数学推理和图表问答等任务上,对各种LLM和视觉语言模型骨干的评估表明,SMMD的性能始终优于现有方法。

  7. TOOL · CL_91401 ·

    新的LLM强化学习策略增强探索能力

    研究人员推出了一种名为深度密集探索(DDE)的新策略,旨在改进大型语言模型的强化学习。DDE专注于探索不成功轨迹中的深度、可恢复状态,这是当前GRPO和基于树的方法等方法难以解决的挑战。DDE中提出的DEEP-GRPO实现使用数据驱动的效用函数来识别这些关键的“支点”状态,从而实现局部密集重采样和双流优化,以实现更有效的学习。在数学推理任务上的实验表明,DEEP-GRPO的性能显著优于现有基线。

  8. TOOL · CL_40802 ·

    代码并不能提高LLM的数学推理能力;结构化追踪可以

    一篇新的研究论文探讨了代码对大型语言模型数学推理能力的影响。研究发现,虽然代码可以提高编程能力,但它并不能普遍增强数学推理能力,甚至可能与知识密集型任务产生竞争。研究人员发现,结构化推理追踪(如数学-文本混合)比单独的可执行代码更能有效地提高推理能力。他们建议,增加结构化数学领域样本的密度,可以提供一种有针对性的方法来提升数学推理能力,而不会牺牲编程性能。

  9. RESEARCH · CL_20433 ·

    新的自蒸馏方法增强了大型语言模型的推理能力和训练稳定性

    两篇新论文探讨了用于大型语言模型的先进自蒸馏技术,旨在提高推理能力和效率。第一篇论文介绍了“Power Distribution Bridges”,它连接了采样、自奖励强化学习和自蒸馏,表明功率分布可以优化 KL 正则化强化学习并实现一种新的离线蒸馏形式。第二篇论文提出了“基于偏好的自蒸馏”(PBSD),超越了简单的 KL 匹配,采用了一种奖励正则化目标来优化偏好差距,从而提高了训练稳定性和在推理及工具使用基准测试上的性能。