研究人员开发了一种新颖的混合离线-在线多智能体强化学习框架,称为决策变换器(Decision Transformers)。该方法首先使用现有轨迹上的监督序列建模进行离线策略预训练,确保安全高效的起点。然后,它使用包含评判器引导梯度(critic-guided gradients)的混合目标在线优化此策略,从而在初始离线策略之外实现性能提升。该框架采用了回报加权采样(return-weighted sampling)和邻域相关探索(neighborhood-correlated exploration)等技术,以促进稳定迁移和智能体之间的有效协调,在无线资源管理场景中展示了与集中式方法相当的服务质量性能。 AI
影响 这项研究为无线资源管理提供了一种有前景的基于学习的替代方案,有可能在动态网络条件下提高效率和性能。
排序理由 详细介绍无线资源管理新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- Centralized methods
- Decision Transformers
- Multi-agent reinforcement learning
- Neighborhood-correlated exploration
- Quality-of-Service (QoS)
- Return-weighted sampling
- Supervised Sequence Modeling
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →