Thompson sampling
PulseAugur coverage of Thompson sampling — every cluster mentioning Thompson sampling across labs, papers, and developer communities, ranked by signal.
- used by Multi-armed bandits for adjudicating documents in pooling-based evaluation of information retrieval systems 90%
- used by alphaXiv 70%
- instance of ScienceCast 70%
- used by Gotit.pub 70%
- used by CORE Recommender 70%
- authored by alphaXiv 70%
- instance of CatalyzeX 70%
- instance of alphaXiv 70%
- instance of Gotit.pub 70%
- used by CatalyzeX 60%
- authored by Gotit.pub 60%
- authored by ScienceCast 50%
7 天有情绪数据
-
新研究改进高斯过程老虎机优化技术 · 跟踪2个来源
arXiv上的两篇新研究论文探讨了高斯过程老虎机优化方面的进展。第一篇论文侧重于随时间变化的环境,提出了一种具有恒定探索参数的方法,以实现更优的遗憾界限。第二篇论文解决了并行高斯过程老虎机优化问题,展示了如何在不要求初始不确定性采样阶段的情况下,尤其是在无噪声设置中,实现更优的遗憾界限。
-
新框架通过贝叶斯 MCTS 提升 LLM 启发式设计
研究人员开发了 Clade-AHD,一个旨在提高大型语言模型(LLM)自动启发式设计(AHD)中蒙特卡洛树搜索(MCTS)效率的新框架。这种新方法用分支级别的贝叶斯信念取代了传统的节点级别估计,利用 Beta 分布和 Thompson 采样来更有效地建模不确定性和指导探索。实验表明,Clade-AHD 在复杂的优化问题上优于现有方法,同时需要更少的计算资源。
-
新研究探索内存增强进化用于代码优化
两篇新研究论文提出了增强进化算法以进行代码优化和自动化算法设计的新方法。EvoMem 引入了一个持久化内存架构,用于捕获和重用不同运行和任务中的成功变异策略,旨在减少冗余探索。另一方面,PACE 专注于将局部逻辑解耦为称为可执行算法原语(EAP)的持久化单元,以实现有价值代码片段的代码级迁移和重用。
-
DocMemo框架通过动态记忆增强长文档理解能力
研究人员推出了一种新颖的记忆引导框架DocMemo,旨在增强多模态文档理解能力,尤其适用于长文档。该系统通过采用三级检索状态(文档模式记忆、页面信念记忆和问题情节记忆)来解决静态检索和脆弱的跨轮记忆的局限性。DocMemo利用Thompson采样等机制通过贝叶斯信念更新动态优化页面选择,在三个基准测试中取得了最先进的性能。
-
LLMs 增强冷启动推荐的贝叶斯先验 · 跟踪 2 个来源
研究人员开发了一种方法,通过利用大型语言模型 (LLM) 来提高评论推荐系统中的冷启动性能。该方法使用 LLM 从评论文本中提取语义信号,将其转换为贝叶斯先验,从而“预热”Thompson 采样算法。该技术在交互数据稀疏的情况下尤其有益,在积累少量反馈后显示出最大的收益。研究还发现,不同的先验设计,例如性别先验和内容先验,会对用户参与度产生不同的影响,并且在不同人口统计细分群体中的有效性各不相同。
-
Conformal Bandits 框架整合了统计有效性和奖励效率
研究人员推出了一种名为 Conformal Bandits 的新框架,该框架将 Conformal Prediction 整合到用于顺序决策的 bandit 问题中。这种方法旨在提供统计有效性并提高奖励效率,尤其是在传统方法(如 Thompson Sampling 和 Upper Confidence Bound)可能遇到困难的弱臂可分性场景中。该框架提供了有限样本预测覆盖保证,并通过模拟和投资组合分配的应用得到了证明,在遗憾和风险调…
-
新的贝叶斯优化方法增强了光谱数据分析
研究人员开发了一种新的近红外光谱最优波长选择方法,这对于提高光谱数据在糖含量估算等任务中的准确性和可解释性至关重要。该方法将波长选择视为一个二元黑盒优化问题,利用具有 Thompson 采样的贝叶斯优化来识别相关的波长区域。实验表明,与基于遗传算法的选择和模拟退火相比,这种组合贝叶斯优化方法在偏最小二乘回归中表现更优,能够产生更一致、更鲁棒的波长选择。
-
AI研究使用多臂老虎机剪枝神经网络
研究人员开发了一种新颖的方法来剪枝卷积神经网络(CNN)中的特征图,以降低计算成本和存储需求。该方法利用多臂老虎机算法,特别是UCB1和Thompson Sampling,在最小化准确性损失的同时识别和移除冗余特征图。研究表明,这些基于老虎机的算法在MNIST、CIFAR-10和SVHN等各种数据集上,其准确性与未剪枝模型相当,并且显著优于传统的贪婪和基于幅度的剪枝技术。
-
新框架对模型误设下的 Thompson Sampling 进行分类
本文引入了一个新颖的随机稳定性框架,用于分析在潜在模型可能被误设的动态决策场景中的 Thompson Sampling (TS) 算法。该研究对双臂高斯老虎机中的后验演化进行了详细分类,识别出预测极限信念、行动频率和渐近遗憾的明确状态。然后,该框架被推广到有限模型类别,为模型误设下的 TS 行为提供了定性和几何理解,并为结构化老虎机问题中的鲁棒决策奠定了基础。
-
新算法PBTS解决了周期性非平稳老虎机问题
研究人员推出了一种名为周期性自举汤普森采样(PBTS)的新型算法,旨在解决具有周期性非平稳性的老虎机问题。与可能因周期性奖励环境中的过时数据而产生偏差的传统汤普森采样不同,PBTS将信念重置与已知或推断的周期间隔同步。它还包含结构化的自举探索阶段,以清除过时数据,同时保持不确定性估计。在人工环境中进行的实验表明,在周期性非平稳设置下,PBTS与标准汤普森采样相比,累积遗憾显著降低。
-
新研究探讨遗憾最小化和LLM偏好优化
本文介绍了一种新颖的框架,用于在线学习场景中具有分段线性奖励函数的遗憾最小化,适用于合同设计和拍卖等领域。在单调性假设下,所提出的算法实现了 $\widetilde{O}(\sqrt{nT})$ 的严格遗憾界限,解决了学习最优线性合同和在已发布价格拍卖中设定价格的开放性问题。此外,另一篇论文通过开发协方差遗憾泛函的导数理论来探索遗憾优化,并提出了在投资组合倾斜和基于LLM的分配策略中的应用。另一项研究侧重于LLM的偏好优化,提出了一种…
-
引入新的随机重置路径寻找框架用于基于图的学习
研究人员引入了随机重置路径寻找(SRP),这是一个新的情景学习问题,专为涉及有向图上未知边成功概率的场景而设计。该框架适用于量子中继器网络、闪电网络上的支付路由以及网状网络中的交付等各种领域。提出的解决方案,带有UCB(PathUCB)和Thompson Sampling(PathTS)实例化的Log-Dijkstra元算法,提供了路径级遗憾界限,与现有的边级界限相比,为结构化图提供了更详细的见解。实验表明,PathTS在经验上通常表…
-
新的因果老虎机方法利用结构化关系改进决策
研究人员开发了新的因果老虎机方法,该方法利用变量之间的结构化关系来改进决策。所提出的技术,即定向信息采样(IDS)和汤普森采样(Thompson Sampling)的因果变体,旨在处理某些有影响力的变量无法直接操纵的情况。这些方法利用贝叶斯公式和已知的因果图,通过跨干预共享信息来更新奖励估计,在实验中表现优于现有的因果和非因果基线。
-
Thompson Sampling 在贝叶斯老虎机模型中被证明在错误方面具有 2-竞争性
一篇新发表在 arXiv 上的论文详细介绍了一个在贝叶斯老虎机模型方面的理论进展,证明了 Thompson sampling 在错误方面具有 2-竞争性。这意味着 Thompson sampling 所犯的错误预期数量最多是任何其他策略的两倍。该分析适用于独立的潜在臂(arm)过程,其中臂仅在被抽取时才会演变,证实了 Guha 和 Munagala 在 2014 年对随机老虎机提出的猜想。该结果适用于各种加权方案,包括固定视野和几何贴现。
-
新框架应对低自相关二元序列问题
研究人员开发了一种新颖的混合搜索框架来应对复杂的低自相关二元序列问题(LABS)。这种新方法集成了汤普森采样和并行无自相遇行走,能够自适应地在不同搜索空间分区之间分配计算资源。该框架通过 GPU 并行化、共享后验更新、高效邻域评估以及用于防止循环的 Bloom 过滤器得到进一步增强。实验表明,该方法在众多序列长度上均优于现有结果,包括一个优值因子超过 8.0 的新最长序列。
-
新的联合汤普森采样算法改进通信链路自适应
研究人员推出了一种名为联合汤普森采样(Joint-TS)的新算法,用于通信系统的链路自适应。该算法将问题建模为多臂老虎机问题,其中每个调制和编码方案(MCS)都是一个臂。与传统的汤普森采样不同,Joint-TS 使用多元有序 Beta 分布来考虑 MCS 成功概率的固有排序,从而在各种场景下实现更稳健、一致的性能。
-
研究发现贝叶斯优化需要最优初始点
一篇新的arXiv论文探讨了贝叶斯优化(BO)所需的最佳初始点数量。研究表明,寻找全局最优值的总成本与初始批次大小($n_0$)之间存在U形关系,这意味着过少或过多的初始点都会导致资源浪费。这种现象归因于BO在向内聚焦之前倾向于探索超立方体的边界。该研究提出了实际建议,包括在可用时使用多步前瞻BO,在无法调整$n_0$时使用Thompson采样,以及在可以调整时使用更大的$n_0$。
-
新的老虎机算法研究解决了重尾和非平稳问题 · 已追踪 4 个来源
三篇新的研究论文探讨了老虎机算法的进展。一篇论文分析了线性高斯老虎机中 Thompson 采样算法的遗憾,表明了与先验相关的遗憾项和最小最大遗憾项可以解耦。另一篇论文提出了一种统一的误设减少方法,用于处理具有特定轮次可行决策集的非平稳线性老虎机,实现了最优的动态遗憾依赖。第三篇论文解决了具有重尾奖励的批量多臂老虎机问题,揭示了在某些情况下,更重的尾部实际上可能需要更少的批量即可获得接近最优的遗憾。
-
AI 机器人凭借新颖的强化学习策略赢得服装折叠挑战赛
一种新颖的强化学习方法在 LeHome Challenge 2026 的线上和线下比赛中分别获得第一名和第二名,该比赛专注于双臂服装折叠。该系统采用了一种视觉-语言-动作策略,在一个网络中集成了成功率估计和优势计算,以优化效率和实时适应性。关键创新包括异步分布式训练管道、使用 Thompson 采样进行的推理时超参数优化,以及包含类似 DAgger 的数据收集的仿真到现实迁移策略。
-
新的 Thompson 采样方法解决了非平稳和私有的上下文赌博机问题
两篇新研究论文介绍了 Thompson 采样在上下文赌博机方面的新方法。一篇题为“面向非平稳上下文赌博机的流校正 Thompson 采样”的论文提出了一种贝叶斯方法,通过基于显式漂移模型进行校正和重新加权来重用历史数据,其性能优于标准的遗忘基线。第二篇论文“AdaPrivate-TS:具有隐私放大的上下文赌博机的私有 Thompson 采样”提出了一种差分私有算法,该算法将 Thompson Sampling 与批处理 zCDP 组合…