研究人员开发了一个名为PriorityNet的深度强化学习框架,以解决在满足“公平到仅剩一件物品”(EF1)并最大化“纳什社会福利”(NSW)的同时分配不可分割物品的问题。该框架使用近端策略优化(Proximal Policy Optimization)和前瞻性EF1动作掩码(prospective EF1 action masking)来确保每次分配在无需后处理的情况下都保持EF1。实验表明,PriorityNet在离线和在线模式下均实现了高平均归一化NSW值,优于基线方法。 AI
影响 该框架可以提高资源分配问题的公平性和效率,尤其是在5G网络等复杂系统中。
排序理由 该集群包含一篇学术论文,详细介绍了用于资源分配的新算法框架。[lever_c_demoted from research: ic=1 ai=1.0]
- envy-freeness up to one good
- longest-processing-time-first scheduling
- Nash Social Welfare
- Proximal Policy Optimization
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →