Actor-critic algorithm
PulseAugur coverage of Actor-critic algorithm — every cluster mentioning Actor-critic algorithm across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新方法优化资源受限情况下的基础模型微调
研究人员开发了一种新颖的方法,用于在资源受限的设备上优化基础模型的持续微调。通过将问题表述为约束马尔可夫决策过程,他们的方法(一种 actor-critic 算法)学习了一个最优策略来决定何时微调模型。实验表明,该方法可以实现显著的性能提升,在准确率上超越标准微调方法 4% 以上,同时仅使用 25% 的微调步骤。
-
新方法优化了计算资源受限情况下的基础模型微调
研究人员开发了一种基于强化学习的方法,利用 actor-critic 算法,来优化资源受限设备上基础模型的持续微调。该方法解决了在考虑计算成本和性能指标的情况下,决定何时使用传入数据微调模型的问题。该方法将问题构建为约束马尔可夫决策过程,并在准确性方面取得了显著改进,在使用仅 25% 的微调步骤的情况下,达到了全参数微调性能的 97%。
-
新AI框架优化复杂环境中的决策制定
研究人员开发了一种在新方法,用于在大型马尔可夫决策过程中创建面向性能的环境抽象。该方法通过聚合状态并在这些状态内强制执行共享动作分布来专注于优化决策质量。该框架联合调整策略和树状环境抽象,并根据Q值差异精炼状态空间区域,以平衡性能与抽象的复杂性。实证结果表明,与现有的Actor-Critic基线相比,状态压缩显著,样本效率提高,重规划速度更快。
-
新的Actor-Critic算法优化动态风险管理
研究人员开发了一种新的Actor-Critic算法,旨在优化随机策略中的动态风险管理。这种新颖的方法在策略更新中绕过了对转移扰动的需求,并利用无模型价值学习来处理动态分位数和条件在险价值。通过在表现出可验证的风险规避行为的领域进行实证测试,该算法在学习风险规避策略方面表现出卓越的性能。