proximal policy optimisation
PulseAugur coverage of proximal policy optimisation — every cluster mentioning proximal policy optimisation across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新的强化学习交易系统ViperQ集成了拍卖市场理论
研究人员开发了ViperQ,一个专为交易设计的强化学习系统,它融合了拍卖市场理论的原理。该系统利用源自市场微观结构特征(如成交量控制点和价值区域位置)的独特状态表示。在对特斯拉和NVDA的机构逐笔数据进行评估时,ViperQ实现了可控回撤下的显著回报,证明了微观结构感知输入在金融时间序列决策中的有效性。
-
软Actor-Critic增强热泵控制,减少磨损并提高效率
研究人员开发了一种使用软Actor-Critic (SAC) 的新强化学习方法,以改进变频器驱动热泵的控制。该方法旨在通过最小化开关循环来减少压缩机磨损,这是传统热泵控制器中的一个常见问题。在BOPTEST模拟器上测试时,SAC策略显著减少了热不适感并消除了压缩机启动,而Proximal Policy Optimisation (PPO) 则导致了更频繁的循环。
-
DocHRL框架使用强化学习进行成本优化的文档分类
研究人员开发了DocHRL,一个新颖的分层强化学习框架,旨在优化文档分类成本。该系统能根据文档的复杂性、模型推理成本、错误分类惩罚和人工标注费用等因素,为每份文档自适应地选择最高效的分类策略。通过采用两级策略层级,DocHRL可以在视觉分类器、LLM、OCR和人工审核之间进行选择,从而提高分类性能和运营效率。
-
机器人方法使用强化学习处理缺失的传感器数据
研究人员开发了RL4IL,一种新颖的强化学习方法,旨在增强机器人领域的多模态模仿学习,特别是在传感器数据缺失的情况下。该方法利用强化学习从训练库中识别和检索最相关的专家演示。然后,一种软融合技术聚合来自这些选定演示的操作信号,使机器人即使在某些模态不可用时也能预测适当的操作,而无需重新训练系统。
-
新的强化学习算法优化股票交易执行
研究人员开发了一种名为TT-DAC-PS的新型强化学习算法,用于优化股票交易执行。这种确定性Actor-Critic架构采用了多种先进技术,包括双目标、策略平滑和保守Q正则化,以最小化高估误差。该算法在美国股票数据上进行了测试,并证明其在减少执行成本方面优于传统方法和其他强化学习基线。