PulseAugur
实时 14:02:53
实体 policy-gradient method

policy-gradient method

PulseAugur coverage of policy-gradient method — every cluster mentioning policy-gradient method across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 7
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 7
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 7 条
  1. TOOL · CL_151998 ·

    用于主动交易的深度强化学习:LLaMA 3.2 1B 驱动交易决策

    研究人员开发了一种新颖的主动交易方法,使用深度强化学习,特别是针对比特币和特斯拉资产。该系统采用了四种不同的深度强化学习算法:策略梯度、近端策略优化、深度 Q 学习和深度确定性策略梯度。这些代理利用技术指标、周期性日历编码和从 LLaMA 3.2 1B 派生的情感分数来做出每日交易决策。为了增强泛化能力和性能,引入了 Alpha 奖励机制,并通过大量试验优化了超参数。深度确定性策略梯度算法在测试集上表现出卓越的性能,而深度 Q 学习因…

  2. RESEARCH · CL_133173 ·

    AI模型通过提高点击率和质量来改进广告标题生成 · 已追踪2个来源

    两篇新研究论文提出了先进的广告标题生成方法。一篇论文介绍了一种名为COBART的受控、优化、双向、自回归Transformer模型,该模型使用前缀控制令牌进行微调,ROUGE-L得分提高了25.82%,估计点击率提高了5.82%。另一篇论文提出了一种使用强化学习策略梯度的自批判掩码语言模型方法,该方法在语法和创意质量审计方面优于现有的Transformer和LSTM+RL方法,甚至优于人类提交的标题。

  3. RESEARCH · CL_91432 ·

    新研究增强了用于鲁棒强化学习和安全规划的扩散模型

    研究人员正在开发新方法来提高扩散模型在强化学习和规划任务中的鲁棒性和安全性。一种方法是鲁棒正则化策略迭代(RRPI),它通过针对最坏情况动力学进行优化来解决转移不确定性,并在 D4RL 基准测试中表现出强劲的性能。另一组论文介绍了 Kolmogorov Regression 和 DiRecT 等技术,通过提高轨迹规律性来增强扩散策略,从而实现确定性故障检测,并在推理过程中强制执行安全约束,而不会过度约束采样过程。这些进展旨在使扩散模型…

  4. TOOL · CL_53655 ·

    新策略梯度方法解决长时域决策问题

    研究人员开发了一种新方法来解决长时域决策问题,其中即时奖励可能导致有害的长期后果。他们的工作识别了策略梯度方法的两种关键失效模式:“完成”(达到时域终点)和“最优性”(实现最佳可能结果)。通过分离这两种模式,他们提出了一种提高完成率并缩小最优性差距的方法,并在模拟环境中(如砌砖工职业和NBA球员职业)证明了其有效性。

  5. TOOL · CL_61764 ·

    策略梯度方法在长时序决策问题中的分析

    研究人员探索了策略梯度方法在长时序决策问题中的应用,这类问题中即时奖励可能导致重大的未来负面后果。他们识别出两种不同的失败模式:完成(completion),即达到决策时限;最优性(optimality),即在达到时限的情况下做出最佳决策。该研究提出了一种分离这两个问题的方法,并在模拟场景(如砌砖工的职业生涯和NBA球员的职业生涯)中进行了测试,发现他们的方法提高了性能。

  6. RESEARCH · CL_53471 ·

    新的信用分配策略梯度方法改进检索系统训练

    研究人员开发了一种名为“信用分配”策略梯度(CA-PG)的新型强化学习方法,以应对大规模检索系统中早期排序器(ESRs)训练的挑战。传统的策略梯度方法在实际应用中难以处理与候选集大小相关的高方差问题。CA-PG旨在通过基于目标项在任何候选集中被选中的概率来计算梯度,而不是整个集合的联合概率,从而降低这种方差。实验表明,这种方法可以提高收敛速度和训练稳定性,尤其是在大型候选集的情况下,这一点已通过合成和真实世界数据进行了验证。

  7. TOOL · CL_49344 ·

    新分析表明伙伴选择促进多智能体系统中的合作

    研究人员开发了一种分析解决方案,以理解伙伴选择如何影响面临社会困境的多智能体系统中的合作。他们的研究侧重于策略梯度动力学,表明伙伴选择通过改变对手分布来改变奖励格局,从而促进合作。研究结果表明,种群方差是合作出现的关键因素,并且已经推导出了促进合作的种群的充分条件。