Upper Confidence Bound
PulseAugur coverage of Upper Confidence Bound — every cluster mentioning Upper Confidence Bound across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
LLM驱动的机器人通过新颖的策略改进来导航去中心化系统
研究人员开发了一种使用模式约束语言模型在去中心化系统中进行机器人导航的新方法。该方法将大型语言模型(LLM)策略代理、上限置信度(UCB)老虎机和双深度Q网络(Double DQN)控制器集成到每个机器人上。该系统在NetLogo-Python实现中进行了测试,结果表明完整的配置在所有测试场景中都成功到达了目标,并且与其它配置相比,中位数完成时间显著缩短。
-
新算法改进了具有背包约束的上下文老虎机问题的遗憾界限
研究人员为具有背包约束的上下文老虎机问题开发了新算法,该问题涉及在资源受限和奖励不确定的情况下将客户分配给产品。所提出的算法扩展了置信上限(UCB)家族并利用了再优化技术。这些方法实现了 O((ln T)^3 / T) 的平均遗憾,相比于类似动态定价问题的现有界限有了显著改进。
-
Conformal Bandits 框架整合了统计有效性和奖励效率
研究人员推出了一种名为 Conformal Bandits 的新框架,该框架将 Conformal Prediction 整合到用于顺序决策的 bandit 问题中。这种方法旨在提供统计有效性并提高奖励效率,尤其是在传统方法(如 Thompson Sampling 和 Upper Confidence Bound)可能遇到困难的弱臂可分性场景中。该框架提供了有限样本预测覆盖保证,并通过模拟和投资组合分配的应用得到了证明,在遗憾和风险调…
-
量子贝叶斯优化提升航空航天舱体组装效率
研究人员开发了一个量子安全集贝叶斯优化(QBO)框架,以提高航空航天舱体组装的效率。与经典的蒙特卡洛方法相比,这种新方法利用量子算法以更少的样本实现更高的环境响应估计精度。QBO框架利用量子预言机和上限置信度(Upper Confidence Bound)采集函数,为舱体部件选择最优调整,在实验结果中显示出显著更低的维度误差和不确定性。
-
新的联合汤普森采样算法改进通信链路自适应
研究人员推出了一种名为联合汤普森采样(Joint-TS)的新算法,用于通信系统的链路自适应。该算法将问题建模为多臂老虎机问题,其中每个调制和编码方案(MCS)都是一个臂。与传统的汤普森采样不同,Joint-TS 使用多元有序 Beta 分布来考虑 MCS 成功概率的固有排序,从而在各种场景下实现更稳健、一致的性能。
-
EvolveNav框架通过自演化记忆增强零样本导航能力
研究人员推出EvolveNav,一个用于零样本物体目标导航(ZS-OGN)的新型框架,增强了具身智能体在无先验训练的情况下定位目标对象的能力。该自演化系统通过从过去的轨迹构建智能体规则记忆,并使用置信度上限检索策略选择有效规则,在测试时持续改进。记忆引导的预思模块通过预测动作结果,进一步减少了低效探索。实验表明,EvolveNav优于现有基线,成功率提高了10.1%,同时减少了不必要的步骤。
-
新框架校准推荐置信度,以提升用户留存率和多样性
一篇新研究论文介绍了一个推荐系统框架,该框架通过校准模型置信度来改善低活跃和高活跃用户的用户体验。对于低活跃用户,系统采用一种规避风险的策略来降低不可靠推荐的权重,旨在提高用户留存率和满意度。高活跃用户则受益于一种寻求风险的上置信界(UCB)策略,该策略鼓励探索并拓宽内容多样性。这种感知置信度的做法已在一个主要的直播平台上得到验证,在关键指标上显示出显著的改进。
-
新的UCB策略增强了用于边缘计算的自适应深度神经网络
研究人员为边缘计算环境中的自适应深度神经网络(ADNNs)引入了四种新的上限置信界(UCB)策略。这些策略,包括UCB-Bayes、UCB-Tuned和UCB-V,旨在动态平衡精度与能耗和延迟。使用CIFAR数据集在ResNet和MobileViT模型上进行的实验表明,UCB-Bayes收敛速度最快,而UCB-V和UCB-Tuned在精度、延迟和能耗之间提供了最佳的权衡。