实体
policy learning
policy learning
PulseAugur coverage of policy learning — every cluster mentioning policy learning across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天
2 天有情绪数据
最近 · 第 1/1 页 · 共 3 条
-
New score matching method simplifies Bayesian experimental design
研究人员通过将复杂的期望信息增益(EIG)计算与策略学习分离,开发了一种新颖的贝叶斯实验设计(BED)方法。该方法利用分数匹配来隔离EIG的棘手性,将乘法成本转化为加法成本。这大大降低了策略训练的计算负担,从而能够更有效地优化架构搜索和超参数调整等任务,最终提高策略性能。
-
机器人研究在动作和场景生成方面推进世界模型 · 跟踪7个来源
一篇新的教程论文阐述了机器人学中“世界模型”的范围,将其分为观测空间和状态空间两类,并引入了将预测与机器人动作联系起来的“世界动作模型”。同时,一篇研究论文介绍了一种新颖的移动操作世界动作模型ABot-M0.5,该模型采用Transformer混合架构和梦境强制训练策略,取得了最先进的性能。另一个项目Micro-World提供了一个动作控制的交互式世界模型,用于生成开放域场景,并发布了模型权重和代码以促进社区研究。
-
调查探讨了机器人从人类视频和世界模型中学习,同时新的网络解决了驾驶员监控问题。
两篇新的调查论文探讨了机器人学习的进展,重点关注不同的数据获取和利用策略。一篇论文全面回顾了世界模型,这些模型是机器人策略学习、规划和模拟的关键预测表示,并强调了它们随着基础模型和视频生成而演变。第二篇调查侧重于从人类视频中学习机器人操作技能,通过利用丰富的人类活动录像和计算机视觉技术来解决机器人数据扩展的挑战。