OpenAI Gym
PulseAugur coverage of OpenAI Gym — every cluster mentioning OpenAI Gym across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
SPADE框架使用LLM设计自适应训练环境以实现自我改进
研究人员开发了SPADE,一个新颖的自我博弈强化学习框架,其中单个大型语言模型既充当环境设计者又充当推理代理。环境设计者创建具有OpenAI Gym风格界面的自适应、可执行的训练环境,而推理代理则学习在这些环境中执行任务。这种方法旨在通过动态调整训练目标的难度以匹配代理不断发展的能力来实现持续的自我改进,并在各种基准测试中显示出显著的性能提升。
-
新的课程生成框架增强了自主代理导航策略
研究人员开发了一个新的框架,用于在结构化参数化环境中生成课程,以增强自主代理导航策略的鲁棒性。该方法使用单向基于梯度的优化,并结合了分布偏移正则化目标,以提高跨多模态观测空间的泛化能力。在OpenAI Gym环境(特别是赛车变体和双足步行者)中的评估表明,该方法在性能上始终优于多种基线方法,包括标准策略训练、随机参数采样、手动课程以及其他先进技术,如自步强化学习和ALP-GMM。
-
新AI方法使用LLM初始化强化学习代理
研究人员推出ProDVI,一个旨在提高深度强化学习代理样本效率的新框架。ProDVI利用大型语言模型生成Python代码,假设环境动力学,创建用于预训练价值网络的合成转换。这种方法绕过了对预收集数据集或高保真模拟器的需求,为初始化RL代理提供了一种新方法。在OpenAI Gym和DeepMind Control Suite任务上的实验证明了ProDVI在提高无模型RL算法样本效率方面的有效性。
-
AI拳击基准测试评估LLM决策速度和策略
一位开发者创建了一个自主拳击基准测试,用于评估AI的决策能力、适应性和策略。该基准测试模拟了一场街头规则的比赛,AI模型接收比赛数据,并可以利用视觉能力增强输入。由于速度和视觉支持,开发者目前正在使用Google的gemini-flash-live模型进行测试,并指出本地模型对于实时对战来说太慢了。该基准测试跟踪每秒令牌数、端到端延迟、反应延迟、工具正确性、耐力效率和准确性等指标,以评估模型在压力下的性能。
-
大型语言模型探索偏好对齐和失败缓解技术
研究人员正在探索新的方法,以使大型语言模型(LLM)与人类偏好保持一致并缓解特定的失败模式。一种方法使用直接偏好优化(DPO)来利用模型自身的失败作为训练信号,从而减少OCR模型中的文本退化。其他研究侧重于理解和控制LLM的时间偏好推理,为个人代理开发轻量级的本地偏好工具包,以及创建以人为中心的偏好驱动判断框架。诸如“思想包含”(Inclusion-of-Thoughts)和“批判驱动推理对齐”(Critique-Driven Rea…
-
研究人员修复强化学习策略优化中的合成数据故障
研究人员已识别并解决了基于模型的策略优化(MBPO)中的算法故障,MBPO是强化学习中使用的技术。研究发现,MBPO与Soft Actor-Critic(SAC)等其他方法相比,由于尺度不匹配和残差下一状态预测,可能表现不佳,这会导致Critic低估和不可靠的合成数据。引入了一种名为Fixing That Free Lunch(FTFL)的新方法,该方法结合了目标归一化和直接下一状态预测来解决这些问题,在多个基准任务上表现得到改善。
-
新的可解释体验式学习模型在强化学习方面展现出潜力
研究人员引入了一种新颖的可解释体验式学习模型,该模型利用状态历史和全局反馈来构建行为模型。该模型将学习表示为状态之间的转换图,每个转换都由效用和证据计数进行注释。它专为资源有限环境中的强化学习任务而设计,并在 OpenAI Gym Atari Breakout 基准测试上展现出与基于神经网络的解决方案相当的性能。