Multi-objective reinforcement learning
PulseAugur coverage of Multi-objective reinforcement learning — every cluster mentioning Multi-objective reinforcement learning across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新的强化学习算法MO-IKE增强了大型语言模型的知识编辑能力
研究人员开发了一种新的多目标强化学习算法,名为MO-IKE,以改进大型语言模型的上下文知识编辑。该方法将提示构建视为一个结构化实体,同时优化可靠性、泛化性和特异性等竞争性目标,从而解决了先前方法的局限性。MO-IKE训练一个动态检索器来构建更平衡、更连贯的提示,显著提高了Llama-3.2等模型上的编辑成功率和释义一致性。
-
机器学习方法优化卫星到设备能量调度的方案
研究人员开发了一种新颖的基于机器学习的能量调度方法,用于动态非地面网络-无线能量传输(NTN-WPT)系统。该方法旨在优化低地球轨道卫星向用户设备传输能量的能效、任务完成率和任务等待时间。该系统采用三层预测框架,利用图神经网络进行能量传输效率建模,并采用多目标强化学习来平衡相互竞争的目标。
-
多领域强化学习新研究 · 追踪10个来源
arXiv上发表的多篇研究论文探讨了强化学习(RL)的进展及其应用。一项研究侧重于通过决策树剪枝提高RL策略的可解释性,并在控制基准测试中显示出有效性。另一篇论文介绍了一种博弈论逆强化学习方法,用于预测人类驾驶行为,其准确性优于现有方法。此外,研究还探讨了可解释人工智能(XAI)在人机协作中的支持作用、RL组件在样本高效控制中的协同作用,以及多目标RL的网络现代化。其他论文深入研究了轨迹相对滞后蒸馏、信用节约动作到令牌分配,以及在模拟…
-
新的GraphAllocBench基准推动多目标策略学习
研究人员推出GraphAllocBench,一个旨在评估多目标强化学习(MORL)中偏好条件策略学习(PCPL)的新基准。该基准建立在一个名为CityPlannerEnv的新型基于图的资源分配环境之上,与之前的PCPL基准相比,它提供了更大的灵活性和可扩展性。GraphAllocBench包含可定制的目标、多样的偏好条件和复杂的帕累托前沿,以及比例非支配解(PNDS)和排序得分(OS)等新指标,以更好地评估PCPL算法的性能。对现有P…
-
新的AETDICE框架统一了多目标强化学习中的非线性目标
研究人员推出AETDICE,一个旨在统一和优化多目标强化学习(MORL)中非线性目标的新框架。这种名为聚合-期望-变换(AET)框架的新方法,弥合了之前两个独立范式——标量化期望回报(SER)和期望标量化回报(ESR)之间的差距。AETDICE是一种离线强化学习算法,它利用AET框架,能够从静态数据集中进行基于样本的优化,解决了风险规避和公平性等复杂权衡问题,这些问题以前难以处理。
-
新的MORL方法解决公平性和智能体协调问题
研究人员开发了用于多目标强化学习(MORL)的新方法,以解决公平性和协调性挑战。其中一篇论文介绍了在MORL中学习公平帕累托最优策略的算法,重点是通过适应历史不公平性来满足多样化的用户偏好。另一篇论文提出了用于合作多目标多智能体强化学习(MOMARL)的偏好协调多智能体策略优化(PCMA),能够协调智能体特定的偏好以提高团队绩效和权衡协调。
-
研究人员比较用于自动驾驶汽车需求测试的强化学习方法
一项新研究对用于测试自动驾驶汽车的强化学习技术进行了实证评估,特别比较了单目标强化学习(SORL)和多目标强化学习(MORL)在生成关键场景方面的表现。研究表明,虽然两种方法都能发现需求违反,但MORL倾向于产生更多样化的场景,而SORL可能暴露更严重的问题。MORL和SORL之间的选择取决于优先考虑场景多样性还是违规的严重性,MORL更适合广泛的覆盖范围。