PulseAugur
中
实时 17:54:01
实体 CMDPs

CMDPs

PulseAugur coverage of CMDPs — every cluster mentioning CMDPs across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_277234 ·

    新算法在对抗性线性CMDPs中实现最优遗憾

    研究人员开发了一种新的对偶算法,该算法在具有未知转移的周期性对抗性线性CMDPs中实现了最优的 $\widetilde{\mathcal{O}}(\sqrt{K})$ 遗憾和累积约束违反。这种新算法克服了先前方法(受限于 $\widetilde{\mathcal{O}}(K^{3/4})$)的局限性。该方法结合了自适应的FTRL(Follow the Regularized Leader)、收缩值估计和指数Lyapunov函数,消除了…

  2. RESEARCH · CL_154008 ·

    多领域强化学习新研究 · 追踪10个来源

    arXiv上发表的多篇研究论文探讨了强化学习(RL)的进展及其应用。一项研究侧重于通过决策树剪枝提高RL策略的可解释性,并在控制基准测试中显示出有效性。另一篇论文介绍了一种博弈论逆强化学习方法,用于预测人类驾驶行为,其准确性优于现有方法。此外,研究还探讨了可解释人工智能(XAI)在人机协作中的支持作用、RL组件在样本高效控制中的协同作用,以及多目标RL的网络现代化。其他论文深入研究了轨迹相对滞后蒸馏、信用节约动作到令牌分配,以及在模拟…

  3. RESEARCH · CL_123086 ·

    AI研究探索强化学习和自然语言处理中的结构泛化 · 跟踪2个来源

    两篇新研究论文探讨了AI模型泛化的不同方面。第一篇论文聚焦于离线强化学习,认为数据集中悲观主义的结构比数据量本身对泛化更为关键。它提出,通过一致性损失应用数据增强,可以通过强制执行对称价值函数来改善泛化。第二篇论文研究了自然语言处理中的结构泛化,提出了一种编码方向性的新解析器。该解析器使用BERT-base编码器,在特定的方向性任务上优于先前最先进的模型,表明整合方向性信息是某些类型语言泛化的关键。