LinUCB
PulseAugur coverage of LinUCB — every cluster mentioning LinUCB across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新的arXiv论文推进了多臂老虎机算法和遗憾最小化
arXiv上发表的多篇研究论文探讨了多臂老虎机算法的进展。其中一篇论文解决了具有遗忘对手的老虎机的最优切换遗憾问题,提出了一种无论切换次数如何都能实现最优遗憾的单一算法。另一项研究侧重于在随机半老虎机环境中选择具有最小最长路径长度的k条路径,这与并行数据传输相关。进一步的研究调查了具有任意自适应动作集的线性上下文老虎机,实现了近乎最小最大最优的遗憾界限。此外,论文还深入研究了具有探测和获胜反馈的老虎机设置、满意遗憾最小化以及非单调凸脊…
-
Bandit 系统实时优化电子商务页面布局
研究人员开发了一个可扩展的系统,使用上下文 Bandit 算法实时优化电子商务产品页面布局。这种机器学习方法通过考虑与用户、商品和类别相关的特征,动态地为每个用户会话选择最有效的布局。该系统采用 LinUCB 策略来平衡探索和利用,通过从实时用户交互中学习来改进参与度指标。在主要零售平台上进行的初步 A/B 测试部署显示,与现有的启发式方法相比,性能有所提升。
-
新的老虎机算法通过奖励衰减建模解决LLM优化问题
研究人员开发了一种新的上下文老虎机算法,旨在改进大型语言模型(LLM)的迭代优化。该算法明确地对奖励衰减进行建模,解决了当静态提示或臂被反复使用时发生的过度开发问题。通过使用期望最大化(EM)算法,该方法联合估计臂特定参数和衰减参数,这与传统的线性上置信界(LinUCB)框架不同。在情感反转和GSM8K基准测试上的实验表明,与现有方法相比,性能有了显著提高。
-
Kairos框架通过鲁棒学习技术增强新闻推荐
一篇新研究论文介绍了Kairos,一个旨在改进新闻推荐系统的框架,特别是在交互数据有限和内容生命周期短的场景下。Kairos采用基于Cholesky分解的LinUCB方法来保持数值鲁棒性,并防止协方差矩阵出现问题。Matryoshka表示学习(MRL)的集成也解决了推理延迟问题,从而在不牺牲排序精度的情况下实现了显著的效率提升。
-
新方法通过图约简和离线学习增强上下文老虎机算法 · 跟踪3个来源
研究人员开发了新的上下文老虎机(contextual bandits)方法,这是一种专注于顺序决策的机器学习问题。一种名为GraphDR-LinUCB的方法利用图降维技术,通过将臂特征投影到谱子空间来提高推荐和广告系统的性能。该方法实现了$\wtO(k\sqrt{T})$的遗憾界限,在多个真实数据集上显著优于全维方法和其他图感知技术。另一个框架,离线估计到决策(Offline Estimation to Decisions, OE2D…
-
新框架增强了对错误指定的上下文老虎机模型的统计推断
一篇新研究论文解决了上下文老虎机算法中的统计推断挑战,特别是在结果模型被错误指定的情况下。作者指出,像LinUCB这样的标准算法在这种情况下可能导致估计量不稳定和推断无效。为了解决这个问题,他们提出了一种逆概率加权的Z估计框架,该框架在称为比例逆倾向收敛的条件下确保了一致性和渐近正态性。该框架在模拟和实际应用中被证明能提供可靠的覆盖范围和具有竞争力的性能。
-
新的强化学习框架增强了多燃料发动机的燃烧控制
研究人员开发了一个新的强化学习框架,以改进多燃料压燃发动机的燃烧相位控制。该系统解决了燃料反应活性不确定和时变的问题,燃料反应活性通过十六烷值(CN)量化,这使得精确控制变得复杂。所提出的框架利用门控循环单元(GRU)从燃烧历史中学习燃料反应活性的紧凑表示,使控制策略能够基于此估算信号做出决策,而不是依赖于一个预知的CN值。这种方法旨在防止训练-部署不一致,并实现稳定的CA50调节,即使在CN快速变化的情况下也能实现低跟踪误差。
-
新的 BITE 框架利用 LLM 裁判偏见来提高分数
研究人员开发了一种新颖的黑盒对抗框架 BITE,该框架利用 LLM 裁判的风格偏见来人为地提高其分数。通过将风格化编辑的选择框定为上下文老虎机问题,BITE 使用 LinUCB 策略来适应性地选择能够最大化裁判分数的编辑,而无需访问模型参数。该框架成功实现了超过 65% 的攻击成功率,并将 9 分制的分数提高了 1-2 分,同时保持了语义等价性并逃避了检测方法,凸显了 LLM 作为裁判范式中的一个重大漏洞。
-
新的 Bandit 算法应对对抗性攻击和复杂应用
研究人员正在探索 Bandit 算法的新前沿,重点关注其在复杂场景中的应用和鲁棒性。一篇论文研究了高维离线 Bandit 上的对抗性攻击,揭示了用于评估生成式 AI 的奖励模型的漏洞。其他研究深入探讨了理论进展,例如方差敏感 Thompson 采样、重试感知 Bandit 的有限时间遗憾分析以及对抗性线性上下文 Bandit 的改进算法。此外,还有研究考察了 Bandit 在潜在状态环境、具有延迟反馈的决斗 Bandit,甚至深度脑刺…