研究人员开发了一种新颖的神经符号世界模型,旨在改进强化学习中的零样本任务迁移。该模型将观测重建与奖励预测解耦,使其能够在相同的符号状态空间上,无需额外的环境交互即可适应新定义的奖励函数。该方法旨在克服纯粹神经世界模型的局限性,这些模型通常学习不可解释的、任务相关的潜在表示,从而阻碍了泛化能力。 AI
影响 这项研究可能催生出更具适应性的强化学习代理,能够以更少的特定训练来应对更广泛的任务。
排序理由 关于强化学习中世界模型新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- CORE Recommender
- DagsHub
- Gotit.pub
- Hugging Face
- Influence Flower
- Neural World Models
- Neurosymbolic World Models
- Observation Reconstruction
- reinforcement learning
- Reward prediction in primate basal ganglia and frontal cortex
- ScienceCast
- Symbolic state space reduction with guarded terms for rewriting modulo SMT
- Zero-Shot Task Transfer
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →