研究人员开发了C-ICPE,一种用于连续决策空间中贝叶斯固定置信度纯探索的新型模型。这种理论指导的方法对顺序架构进行元训练,以联合学习探索、停止和推荐策略。与现有的频率学派和特定模型方法不同,C-ICPE可以在推理时无需参数更新即可识别ε-最优推荐,使其适用于连续推荐空间。 AI
影响 引入了一种在连续决策空间中学习的新方法,有可能提高诸如赌博机问题和函数最小化等任务的效率。
排序理由 该集群包含一篇详细介绍特定机器学习问题新模型的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →