研究人员探索了近端策略优化(PPO),一种强化学习算法,在具有分析求解动态的连续时间经纪人-交易者博弈中的应用。他们发现,虽然PPO在简单条件下可以近似最优策略,但在涉及随机订单流的复杂场景中却举步维艰。研究还表明,分析解可以作为诊断RL性能的宝贵基准,并作为策略适应的有效起点。 AI
影响 评估了当前强化学习算法在复杂、可分析求解的金融市场中的局限性。
排序理由 学术论文,详细介绍了强化学习在新颖应用和特定领域的评估。[lever_c_demoted from research: ic=1 ai=1.0]
- Broker-Trader Game
- Certainty-Equivalent Controller
- FFNN–TabNet: An Enhanced Stellar Age Determination Method Based on TabNet
- long short-term memory
- mathematical finance
- Monte Carlo
- Proximal Policy Optimization
- reinforcement learning
- supervised learning
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →