OpenAI Five
PulseAugur coverage of OpenAI Five — every cluster mentioning OpenAI Five across labs, papers, and developer communities, ranked by signal.
-
OpenAI 训练机器人手通过高级模拟解决魔方
OpenAI 开发了一个系统,使用两个神经网络使机器人手能够解决魔方。这些网络完全在模拟中使用强化学习和一种称为自动域随机化 (ADR) 的新技术进行训练。这种方法允许系统泛化到现实世界的物理任务,即使是那些在训练期间没有遇到的任务,也展示了强化学习在虚拟环境之外的潜力。虽然机器人可以 60% 的时间解决魔方,但这一成就标志着朝着能够进行复杂操作的通用机器人迈出了重要一步。
-
OpenAI代理在捉迷藏游戏中展现出涌现的工具使用能力,推动AI策略发展
OpenAI的研究人员在一个模拟的捉迷藏游戏中展示了涌现的工具使用能力,代理在没有明确指令的情况下开发了复杂的策略。通过多代理竞争,代理学会了与物体互动和导航环境,展示了自我监督的自动课程。这项研究表明,多代理协同适应可能在未来带来高度复杂的行为,利用与OpenAI Five等先前OpenAI项目类似的训练基础设施。
-
OpenAI Five AI 在历史性的电子竞技比赛中击败 Dota 2 世界冠军
OpenAI Five 在 OpenAI Five 总决赛中以两场连胜击败了 Dota 2 世界冠军,取得了重要的里程碑。这是首次有 AI 在直播比赛中公开战胜职业电子竞技选手。AI 的成功归功于训练计算量的巨大增加,使用了比之前版本多 8 倍的资源。除了比赛之外,OpenAI Five 还展现了与人类队友合作的意外能力,预示着未来有益的 AI 应用潜力。
-
Ilya Sutskever 离开 OpenAI;Jakub Pachocki 被任命为新首席科学家
Ilya Sutskever 将离开 OpenAI,Sam Altman 宣布 Jakub Pachocki 将接任首席科学家一职。Pachocki 此前曾负责 GPT-4 和 OpenAI Five 的研究,现在将领导公司迈向 AGI 的进程。OpenAI 还概述了几个关键研究领域,包括检测隐蔽 AI 系统、构建用于编程竞赛的代理、网络安全防御以及创建复杂的代理模拟。
-
OpenAI 通过 Dota 2、安全性和泛化性推进强化学习
OpenAI 发布了一系列研究论文,详细介绍了强化学习方面的进展。其中包括 OpenAI Five 在 Dota 2 中取得超越人类的表现,开发了 RL 安全探索的基准,并使用 CoinRun 环境量化了泛化能力。该公司还探索了新颖的方法,例如基于预测的奖励以实现好奇心驱动的探索,学习多智能体系统中的策略表示,以及一种名为 Evolved Policy Gradients 的实验性元学习方法,以加快新任务的训练速度。进一步的研究解决了…