PulseAugur
实时 07:53:16
实体 multi-armed bandit

multi-armed bandit

PulseAugur coverage of multi-armed bandit — every cluster mentioning multi-armed bandit across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 8
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 8
层级分布 · 90 天
主题
关系
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 8 条
  1. TOOL · CL_218963 ·

    LLM论文评分框架使用老虎机方法将成本降低78%

    研究人员开发了一种新的高效大型语言模型(LLM)论文评分框架,利用多臂老虎机(MAB)方法自适应地选择最佳提示策略。该方法显著减少了所需的LLM调用次数,在评分准确性上可与穷举方法相媲美,同时将成本降低了78%以上。该研究还引入了成本-可靠性学习曲线,为教育技术平台在运营成本和评估有效性之间取得平衡提供了宝贵的见解。

  2. TOOL · CL_206194 ·

    语义土匪揭示了大型语言模型(LLM)的探索偏见源于语言先验

    研究人员引入了“语义土匪”的概念,以分析大型语言模型(LLM)在决策任务中如何探索和利用选项。该框架强调,LLM 的探索行为显著受到其语言预训练产生的语义先验的影响,而不仅仅是任务的正式结构。研究发现,语义信息丰富的标签会导致探索减少和利用增加,如果语义信息与实际奖励结构不匹配,这可能会产生不利影响。此外,LLM 对负奖励比对正奖励更倾向于探索,这表明其基于语言的训练中存在固有的偏见。

  3. RESEARCH · CL_205806 ·

    新研究探讨老虎机算法以改进决策和减少遗憾 · 跟踪 8 个来源

    几篇近期研究论文探讨了老虎机算法的进展,这是一种顺序决策框架。一篇论文介绍了潜在顺序老虎机(LOB),它通过仅要求了解状态内动作偏好的部分顺序来放宽先前潜在老虎机算法的假设,从而提高样本效率。另一项研究侧重于多臂老虎机中遗憾与不稳定性之间的权衡,提出了一种新的算法 SLE-UCB,该算法匹配理论下界。进一步的研究解决了具有任意反馈延迟的 Lipschitz 老虎机,开发了实现强遗憾保证的算法,并探讨了容量受限延迟老虎机优化中的条件能量…

  4. TOOL · CL_183263 ·

    新算法使用多臂老虎机优化NLP模型评估

    研究人员开发了用于多臂老虎机问题的新算法,以优化自然语言处理(NLP)模型的评估。这种方法将标注工作集中在最有前途的模型上,与传统的穷举评估方法相比,降低了成本并提高了可扩展性。所提出的算法旨在提高顶尖模型之间的区分度,从而提高大规模竞赛的效率。

  5. TOOL · CL_145886 ·

    AI框架A-IC3通过自适应策略增强硬件模型检查

    研究人员开发了A-IC3,一个新颖的框架,通过结合机器学习来增强用于硬件模型检查的IC3算法。这种新方法使用多臂老虎机算法动态选择归纳泛化策略,适应不断变化的验证上下文。实证结果表明,A-IC3的性能显著优于现有方法,在基准套件上解决了更多案例并提高了分数。

  6. TOOL · CL_141627 ·

    新的联合汤普森采样算法改进通信链路自适应

    研究人员推出了一种名为联合汤普森采样(Joint-TS)的新算法,用于通信系统的链路自适应。该算法将问题建模为多臂老虎机问题,其中每个调制和编码方案(MCS)都是一个臂。与传统的汤普森采样不同,Joint-TS 使用多元有序 Beta 分布来考虑 MCS 成功概率的固有排序,从而在各种场景下实现更稳健、一致的性能。

  7. RESEARCH · CL_14204 ·

    新研究推进了控制、因果关系和多目标学习的赌博机算法

    多篇研究论文探讨了赌博机算法在各个领域的进展。一项研究引入了一个机器学习框架,用于流体式躁动多臂赌博机问题的最优控制,在机器维护和疫情控制等应用中实现了显著的加速。另一篇论文挑战了因果赌博机中图学习的最优性,提出了新的算法,绕过图恢复以改进遗憾最小化。进一步的研究探讨了多目标赌博机的复杂性,表明帕累托遗憾的规模与单目标问题相似,并研究了在具有动态代理人口的开放多代理系统中的赌博机学习。其他工作解决了具有对抗性上下文的约束上下文赌博机、…

  8. RESEARCH · CL_01054 ·

    研究人员推进贝叶斯优化以实现高效决策和超参数调整

    近期几篇arXiv论文探讨了多臂老虎机问题的进展,这是一个在不确定性下进行序贯决策的框架。研究内容包括处理“闪烁多臂老虎机”中变化的动作可用性,以及在不严格假设上下文多样性的情况下改进逻辑老虎机的遗憾界限。其他工作则侧重于几何感知离线到在线学习、图上平滑函数的谱老虎机,以及广义线性上下文老虎机的隐私保护算法。