MuZero
PulseAugur coverage of MuZero — every cluster mentioning MuZero across labs, papers, and developer communities, ranked by signal.
-
AI拳击基准测试评估LLM决策速度和策略
一位开发者创建了一个自主拳击基准测试,用于评估AI的决策能力、适应性和策略。该基准测试模拟了一场街头规则的比赛,AI模型接收比赛数据,并可以利用视觉能力增强输入。由于速度和视觉支持,开发者目前正在使用Google的gemini-flash-live模型进行测试,并指出本地模型对于实时对战来说太慢了。该基准测试跟踪每秒令牌数、端到端延迟、反应延迟、工具正确性、耐力效率和准确性等指标,以评估模型在压力下的性能。
-
新AI架构在消费级硬件上提升围棋表现
研究人员开发了一种新的围棋AI信念引导架构,旨在提高在消费级硬件上的性能。该架构将策略头与一个独立的信念头分开,后者模拟认知不确定性和战略稳定性。通过引入记忆机制和门控机制来过滤过度自信的策略错误,该模型将智能从运行时搜索转移到参数化直觉,显著提高了无搜索胜率并减少了幻觉。
-
英伟达的开源推动获得关注,但Anthropic仍是例外
英伟达CEO黄仁勋发起了一项开源倡议,获得了包括OpenAI和Microsoft在内的70多家公司和组织的支持。然而,Anthropic却显著未签署该倡议,一位Anthropic员工公开质疑此次开源推动的诚意,并暗示英伟达自身的闭源实践,如CUDA和GPU驱动程序,也应开源。此次交流引发了关于开源倡导背后真实意图及其对AI生态系统的潜在影响的辩论,尤其是在硬件依赖方面。
-
多领域强化学习新研究 · 追踪10个来源
arXiv上发表的多篇研究论文探讨了强化学习(RL)的进展及其应用。一项研究侧重于通过决策树剪枝提高RL策略的可解释性,并在控制基准测试中显示出有效性。另一篇论文介绍了一种博弈论逆强化学习方法,用于预测人类驾驶行为,其准确性优于现有方法。此外,研究还探讨了可解释人工智能(XAI)在人机协作中的支持作用、RL组件在样本高效控制中的协同作用,以及多目标RL的网络现代化。其他论文深入研究了轨迹相对滞后蒸馏、信用节约动作到令牌分配,以及在模拟…
-
新的COMET算法通过面向对象的方法增强AI规划
研究人员推出了一种新颖的基于模型的强化学习规划算法COMET。COMET在基于槽的潜在空间中利用蒙特卡洛树搜索,将一个固定的无监督对象中心编码器与一个基于Transformer的世界模型配对。它包含一个独特的动作槽融合机制和对象因果注意力,以将决策集中在相关实体上。在跨不同任务的早期训练阶段,COMET在与现有的对象中心和整体基线相比,表现出了卓越的性能。