PulseAugur
中
实时 03:32:03
实体 Sequential decision making

Sequential decision making

PulseAugur coverage of Sequential decision making — every cluster mentioning Sequential decision making across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 3
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_227176 ·

    新算法优化用于顺序决策的 LLM 提示

    研究人员开发了一种名为 EXPO-ES 的新算法,用于自动优化用于顺序决策任务的大型语言模型(LLM)的元提示。该方法借鉴了对抗性赌博算法的思路,以处理该领域常见的非平稳奖励观察。EXPO-ES 算法可以优化元提示中的任务描述、元指令和交互历史,以提高 LLM 代理的性能,大量实验表明性能有显著提升。

  2. RESEARCH · CL_208376 ·

    新的风险量化方法增强了AI代理在不确定性下的安全性

    研究人员开发了新的方法,使代理能够在不确定环境中量化和管理风险,尤其是在学习阶段。一种方法RATTL(Risk-Adversarial Total-Reward Learning)通过使用贝叶斯后验来定义一个Wasserstein模糊集,将谨慎与认知不确定性联系起来。这使得代理能够随着对环境理解的提高,动态地调整其行为,从鲁棒的最坏情况规划转向风险中性最大化。一种相关的方法Wasserstein熵值风险,提供了一种连贯的风险度量,它考…

  3. RESEARCH · CL_27625 ·

    新论文探讨顺序决策的理论界限

    两篇新的arXiv论文探讨了机器学习中顺序决策的理论框架。第一篇论文引入了一个“机制信息”度量,用于量化结合了物理先验和学习残差的混合模型的价值,在模拟中展示了样本效率的提高,并警告不要在安全关键型应用中使用LLM先验。第二篇论文开发了一个顺序超采样框架,为自适应数据设置建立信息论泛化界限,适用于在线学习、流式主动学习和多臂老虎机。