Masahiro Kato 的一篇新研究论文介绍了一种在固定预算场景下进行最佳臂识别的新策略。提出的自适应程序包括一个两阶段采样阶段,首先进行均匀分配以消除次优臂并估计方差。随后,通过解决一个高斯 minimax 博弈来确定第二阶段的采样策略和决策规则。该策略被证明在简单遗憾方面同时具有渐近 minimax 和 Bayes 最优性,其上限与已建立的下限相匹配,并且不需要了解结果分布或先验知识。 AI
排序理由 该集群包含一篇发表在 arXiv 上的学术论文。[lever_c_demoted from research: ic=1 ai=0.4]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →