实体
proximal policy optimisation
proximal policy optimisation
PulseAugur coverage of proximal policy optimisation — every cluster mentioning proximal policy optimisation across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 3 条
-
DocHRL框架使用强化学习进行成本优化的文档分类
研究人员开发了DocHRL,一个新颖的分层强化学习框架,旨在优化文档分类成本。该系统能根据文档的复杂性、模型推理成本、错误分类惩罚和人工标注费用等因素,为每份文档自适应地选择最高效的分类策略。通过采用两级策略层级,DocHRL可以在视觉分类器、LLM、OCR和人工审核之间进行选择,从而提高分类性能和运营效率。
-
机器人方法使用强化学习处理缺失的传感器数据
研究人员开发了RL4IL,一种新颖的强化学习方法,旨在增强机器人领域的多模态模仿学习,特别是在传感器数据缺失的情况下。该方法利用强化学习从训练库中识别和检索最相关的专家演示。然后,一种软融合技术聚合来自这些选定演示的操作信号,使机器人即使在某些模态不可用时也能预测适当的操作,而无需重新训练系统。
-
新的强化学习算法优化股票交易执行
研究人员开发了一种名为TT-DAC-PS的新型强化学习算法,用于优化股票交易执行。这种确定性Actor-Critic架构采用了多种先进技术,包括双目标、策略平滑和保守Q正则化,以最小化高估误差。该算法在美国股票数据上进行了测试,并证明其在减少执行成本方面优于传统方法和其他强化学习基线。