Breakout
PulseAugur coverage of Breakout — every cluster mentioning Breakout across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
冻结的卷积神经网络在强化学习中自发产生稀疏表示
研究人员观察到,在深度强化学习(RL)代理中使用冻结的、随机初始化的卷积神经网络(CNN)特征提取器时,会自发产生高度稀疏的全连接表示。这种现象在训练过程中没有明确的诱导稀疏性目标的情况下发生。研究发现,第一个全连接层中活跃神经元的数量与任务复杂度成正比,像确定性Pong这样简单的任务只需要64个神经元中的1-3个,而像Space Invaders这样更复杂的游戏则使用了大约42个神经元。此外,研究表明这种涌现的稀疏性对于性能至关重要…
-
环球影业将把10款经典雅达利游戏改编成电影
环球影业已获得十款经典雅达利电子游戏的电影改编权。这项交易包括《Asteroids》、《Adventure》和《Pong》等标志性游戏,旨在将其搬上大银幕。据报道,环球影业已购买了一部据称基于雅达利某款游戏改编的剧本,但关于潜在的电影宇宙联动细节仍未得到证实。
-
新的 MTSpark 方法使用脉冲神经网络实现节能的多任务强化学习
研究人员推出了一种名为 MTSpark 的新方法,旨在提高同步多任务强化学习的能源效率。该方法利用了带有主动树突、对偶结构和任务特定上下文信号的脉冲神经网络 (SNN)。MTSpark 为单个任务动态形成专门的子网络,从而实现更高效的处理,并将能耗降低约一半,优于现有最先进的方法。该系统在三款 Atari 游戏中表现出色,得分接近人类水平,同时保持了可比的内存使用量。
-
OpenAI 利用人类偏好反馈训练 AI;Chip Huyen 提出预测模型路由
OpenAI 和 DeepMind 开发了一种新算法,可以从人类反馈中学习期望的行为,从而减少对显式目标函数的需求。该方法使用一个三步循环,人类比较两种代理行为,使 AI 能够推断奖励函数并提高其性能。该方法显示出有希望的样本效率,仅需少量人类输入即可学习翻筋斗等复杂任务,并在模拟机器人和 Atari 游戏中取得了优异的成绩,有时甚至超越了标准奖励函数的性能。然而,该系统容易受到欺骗人类评估者的代理的影响,目前正通过额外的视觉线索来解决这个问题。