Online Convex Optimization
PulseAugur coverage of Online Convex Optimization — every cluster mentioning Online Convex Optimization across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新的元学习框架解决了在线优化中的动态遗憾问题
研究人员开发了一个新的元学习框架,用于解决在线凸优化中的动态遗憾问题,特别是在处理指示器切换成本时。该成本考虑了当连续决策不同时发生的服务器激活或模型部署等开销。所提出的算法,即由通过最大耦合采样动作的主算法聚合的一组随机惰性FTRL基础学习器,实现了动态遗憾加上累积切换成本的理论界限。该界限对于跟踪分段常数比较器是 minimax 最优的,并且还可以处理频繁移动的比较器。
-
专家问题和OCO的极小极大交替遗憾已解决 · 跟踪2个来源
研究人员已经解决了专家问题和在线凸优化(OCO)的极小极大遗憾率问题。对于d专家问题,极小极大交替遗憾被证明是 $\Theta(\log d)$,独立于时间跨度T。这比Hait等人建立的 $\mathcal{O}(T^{1/3}\log^{2/3} d)$ 等先前界限有了显著改进。对于d维紧凸集上的通用OCO,极小极大交替遗憾是 $\Theta(d\log(1+T/d))$,也比先前结果有了实质性改进。这些发现是通过对Hedge等现有…
-
新方法利用成对反馈解决在线凸优化问题
研究人员引入了一种新颖的在线凸优化方法,该方法利用对偶(成对比较)反馈。该方法将二元偏好数据转换为近似梯度,从而可以应用标准的一阶优化技术。所提出的约简成功地转移了遗憾保证,为该特定场景建立了第一个已知结果,包括静态、自适应和动态遗憾的 O(T^{3/4}) 界限。进一步的改进为平滑目标产生了 O(T^{2/3}) 的速率,为强凸函数产生了 O(sqrt(T log T)) 的速率。
-
新方法确保关键物联网系统实时安全
一篇新论文介绍了一种名为 OCO-PAoI-Hard 的方法,通过保证信息年龄 (AoI) 保持在硬截止时间以下,来确保关键物联网系统的实时安全性。该方法通过在对抗性条件下运行并实现 AoI 状态的零每时隙违规,解决了先前方法的局限性。该方法将硬实时调度转化为受约束的在线凸优化问题,利用因果提议-屏蔽-更新循环,通过欧几里得投影强制执行可行性并保持无悔行为。
-
新理论在在线凸优化中实现对数高概率遗憾
研究人员为在线凸优化(OCO)开发了一个新的理论框架,实现了对数高概率遗憾。这一进展解决了在每步只有两次函数评估的有限反馈下进行学习的挑战。所提出的方法在先前的分析基础上有了显著改进,特别是在维度依赖性方面,与早期工作的二次项相比,其线性依赖性得以保持,同时保持了对迭代次数的对数依赖性。
-
新原理实现最优在线库存优化
研究人员开发了一种新颖的在线库存优化(OIO)原理,该原理可在一般凸集上实现最优性能。该方法通过维护一个隐藏目标并将其投影到可行订货点集上,改进了 OIO 的遗憾界限,并首次为强凸损失提供了对数悔度。该分析引入了一个“范数对齐”原理,将问题简化为一维队列控制,并通过在合成和真实库存数据上的实验进行了验证。
-
新的arXiv论文详细介绍了凸优化技术的进展
arXiv上的两篇新研究论文探讨了凸优化的进展。第一篇论文介绍了一种用于在线凸优化(OCO)的统一探测模型,该模型即使在亚线性和噪声探测预算下也能改善最坏情况下的遗憾。第二篇论文提出了基于哈密顿动力学的算法,实现了光滑凸优化的加速收敛速率,将哈密顿动力学确立为确定性加速凸优化的一种有用基元。
-
AI代理应对时间遗憾和动态优化挑战
两篇新研究论文探讨了改进AI代理决策和学习的先进方法。第一篇论文“Trivium”将时间遗憾作为因果记忆控制器的关键目标,旨在比基于结果的方法更有效地记录和纠正错误。第二篇论文“无参数动态遗憾”提出了一种新颖的在线凸优化算法,该算法处理时变移动成本、延迟反馈和记忆,从而实现了改进的动态遗憾界限。
-
新理论将多面体不稳定性与在线学习遗憾联系起来
研究人员开发了一个新的理论框架,用于理解涉及组合动作的在线学习问题中的遗憾。他们的工作引入了“多面体不稳定性”的概念,该概念量化了决策过程中活动区域的变化次数。这种不稳定性被证明可以决定遗憾率,并在现有的类似专家和依赖维度的界限之间进行插值。