这篇研究论文介绍了一种利用内生马尔可夫状态的新型在线资源分配框架,其中行动会影响未来的状态转换和奖励。该研究确定了频繁或不频繁地重新求解线性规划(LP)问题可带来最优或接近最优结果的条件,重点关注遗憾最小化。该论文提出了一种针对未知请求先验场景的U型不频繁重解策略,并证明了其在协调学习和库存纠正方面的有效性。 AI
影响 为具有复杂状态动态的系统中的资源分配优化引入了理论框架,可能影响 AI 代理设计。
排序理由 该项目是发表在 arXiv 上的学术论文,详细介绍了在线资源分配的新理论框架和策略。[lever_c_demoted from research: ic=1 ai=0.7]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →