PulseAugur
实时 13:04:30
实体 Temporal difference learning

Temporal difference learning

PulseAugur coverage of Temporal difference learning — every cluster mentioning Temporal difference learning across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 4
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 4 条
  1. RESEARCH · CL_145692 ·

    新的TRACE方法增强了AI智能体在长时程任务中的工具使用 · 跟踪2个来源

    研究人员开发了TRACE,一种用于提高多回合AI智能体在复杂、长时程任务中性能的新方法。该技术通过从参考模型的对数概率中推导出每个动作的奖励,而不是仅仅依赖稀疏的结果奖励,来解决信用分配的挑战。TRACE显著提升了Qwen3-4B和Qwen3-30B-A3B等模型在BrowseComp-Plus等基准测试中的工具使用能力,从而加快了收敛速度并改善了学习曲线。

  2. RESEARCH · CL_93139 ·

    新框架使用大型语言模型和强化学习生成复杂的物理应用题

    研究人员开发了 ARVRE,一个用于生成复杂且可解的物理应用题的新框架。该两阶段系统使用时序差分学习来创建有效的物理方程链,并采用智能检索增强生成方法来选择相关概念和词汇。然后,大型语言模型将这些元素转化为自然语言问题,确保数学正确性的同时增强语言的多样性和新颖性。

  3. TOOL · CL_75680 ·

    TD学习未能提高LLM在GSM8K上的少样本检索能力

    一位研究人员探索了TD学习,以改进LLM推理中少样本示例的检索,目标是根据其效用为轨迹分配学习到的值。实验包括存储推理轨迹,检索相似轨迹作为示例,并根据后续解决方案的质量更新其值。然而,一个仅考虑轨迹自身解决方案正确性的更简单的基线表现同样好,这表明TD学习机制在GSM8K基准测试上没有提供额外的好处。

  4. RESEARCH · CL_62198 ·

    李雅普诺夫框架分析随机算法收敛性

    研究人员发表了一篇论文,详细介绍了一个基于李雅普诺夫的框架,用于分析随机迭代算法的有限时间收敛性。该方法使用广义莫罗包络作为通用的李雅普诺夫函数,适用于各种范数和噪声类型。该框架提供了均方收敛保证,并可扩展到随机梯度下降等算法以及Q学习和时间差分学习等强化学习方法。