World Models
PulseAugur coverage of World Models — every cluster mentioning World Models across labs, papers, and developer communities, ranked by signal.
10 天有情绪数据
-
新方法增强了世界模型中机器人的决策能力
研究人员开发了一种在世界模型(WM)的潜在空间中进行鲁棒决策的新颖方法。该方法将潜在空间扰动建模为对学习到的动力学的扰动,确保即使在最坏的情况下,机器人的行为也能保持有效。实验表明,对于Franka机械臂,失败率显著降低,安全过滤减少了70%,样本验证转向减少了54%。
-
AI研究探讨世界模型如何恢复物理定律
一篇新研究论文探讨了在何种条件下,世界模型(一种学习预测未来状态的AI)可以被认为恢复了物理定律。该研究基于明确的实验目录、传感器不确定性和采集预算来构建定律恢复,并提出了一种率失真反比理论,将描述性信息与可观测信息分离开来。研究结果表明,当所有不同的定律都可以通过实验区分时,就可以实现均匀恢复,并且对Lipschitz场的证据采集成本进行了量化。
-
新研究提出世界模型的分层保留方法
一篇新的研究论文提出了一种名为“差异保留”的方法,用于机器学习中的世界模型。与将遗忘视为失败的传统持续学习不同,这种方法承认世界模型必须适应不断变化的环境。该论文主张根据不变性时间尺度对知识保留进行分层,区分永不应修改的物理学等基本原理和应更新的实例级事实。该方法旨在通过评估世界模型修正过时信息同时保留核心不变性的能力来更好地评估它们,解决了当前指标偏向冻结模型的局限性。
-
人工智能研究聚焦“世界模型”以增强预测和模拟能力
“世界模型”的概念在人工智能研究中日益受到关注,被视为开发更强大、更可靠系统的关键方向。这些模型旨在理解、表征、预测和模拟环境,包括行动如何影响结果。这种能力被认为是推动机器人技术、空间智能和视频生成领域进步的关键,超越了简单的模式识别,实现了对世界动力学和因果关系的更深层次理解。
-
世界模型 vs. LLMs:预测物理AI的未来
虽然大型语言模型(LLMs)在为可由文本表示的任务生成令牌组合方面表现出色,但世界模型专注于预测环境状态和因果关系。Yann LeCun和Fei-Fei Li等有影响力的研究人员正在投资世界模型,这些模型接收环境观察和动作,并输出对未来状态的预测。这种区别对于物理AI的发展至关重要,因为在物理AI中,预测结果和理解因果关系的能力对于安全有效的机器人训练至关重要。
-
新框架SMI增强世界模型的长期记忆 · 跟踪3个来源
研究人员推出了一种名为空间记忆智能(SMI)的新型框架,旨在增强世界模型中的长期记忆管理,特别是在长视频生成方面。SMI系统地采用理解模型来组织、稀疏化、检索和过滤空间记忆,以应对管理复杂、长距离空间上下文的挑战。该方法旨在提高记忆稀疏性、生成稳定性和空间一致性,并建立在多模态大型语言模型和统一模型概念的进步之上。
-
新研究推动了用于机器人规划和控制的世界动作模型 · 跟踪了10个来源
近期研究探索了用于机器人控制和规划的世界动作模型(WAMs)的进展。几篇论文介绍了新的架构和训练方法,以提高预测准确性、泛化能力和效率。重点关注的领域包括处理异步执行、增强空间理解以及开发用于训练和评估这些模型(尤其是在复杂、长时程任务中)的更好方法。
-
新的AI框架增强了多智能体通信和协调能力
两篇新的研究论文探讨了多智能体AI系统的先进通信方法。一篇论文介绍了用于协作具身人工智能(CEAI)的Token Communication(TokCom),使用token作为语义载体,在保持任务效率的同时减少通信负载。另一篇论文提出了DuoMind,一个用于分布式多机器人协调的框架,它利用视觉-语言模型进行语义通信,以实现高级推理和动作执行。这两种方法都旨在提高在复杂、动态环境中的协调和任务性能。
-
新框架区分遵守研究设计的流行病学模型
研究人员开发了一个新的框架来评估流行病学模型,区分“忽略设计”和“尊重设计”的方法。这项研究利用了一个大规模的集群随机试验阴性对照试验,发现虽然两种模型类型都能准确地重构观测数据,但尊重设计模型在保持干预对比方面更为稳健。这种区分对于确保模型准确反映研究设计并且不会因数据收集方式而产生误导性结果至关重要。
-
arXiv论文定义了AI中备受争议的“世界模型”概念
一篇arXiv预印本将“世界模型”定义为AI系统用于预测未来状态的内部模拟器。该论文提出了一个开发这些模型的分阶段路线图,并承认AI研究人员仍在争论世界模型在各个子领域中的确切定义和范围。
-
综述梳理机器人智能的世界-动作模型
这篇综述论文全面回顾了用于机器人学习与控制的世界-动作模型(WAMs)。它将现有方法组织成一个统一的分类体系,涵盖了表示、转移建模、动作接口、架构、训练流程、数据模态和扩展策略。论文还探讨了WAM在操作、导航和自动驾驶中的应用,并讨论了诸如动作对齐、空间一致性和长时记忆等关键挑战。目标是为整合预测性世界建模与动作生成奠定技术基础,以增强具身机器人的智能。
-
ECCV 2026 聚焦 AI 预测与行动能力的转变 · 追踪 1 个来源
ECCV 2026 会议将显著增加对世界模型(World Models)和具身人工智能(Embodied AI)的研究,设有 13 个相关研讨会,这标志着人工智能正从理解世界转向预测和行动。这一转变的驱动力在于生成式 AI 的进步使得世界预测能力得到提升,以及机器人和自主系统对新学习范式日益增长的需求。关键讨论将围绕构建、评估和将这些模型整合到可操作的系统中,中国研究人员正积极参与定义边界、建立评估指标以及在真实机器人上部署模型。
-
新研究推动具身AI世界模型发展,聚焦机器人行为与部署
研究人员正在探索具身智能的进展,重点关注连接机器人感知和决策的“世界模型”。论文讨论了从“合理”到“可操作”对这些模型进行分类的框架,强调它们在改善机器人行为和任务执行方面的作用。FluxVLA Engine等平台和Pelican-Sim 1.0等模拟器正在开发中,以简化这些复杂系统的工程和部署,解决数据集成、训练和实际应用中的挑战。
-
AI 的下一个前沿:Mamba、JEPA 和 Diffusion 模型有望取代 Transformer
自 2017 年以来占据主导地位的 Transformer 架构正经历着 AI 领域的周期性转变,可能被状态空间模型(Mamba)和联合嵌入预测架构(JEPA)等新架构取代。这种转变是由 Transformer 的局限性驱动的,例如长上下文的二次方扩展问题、训练数据收益递减、高昂的能源成本以及超越模式匹配实现真正理解的基本能力不足。Gemini Diffusion、Nvidia 的 Nemotron 3 和 Qwen 3.5 等新兴模…
-
新框架推动AI世界模型在模拟和机器人领域的发展 · 跟踪8个来源
几篇研究论文介绍了用于推进世界-动作模型的新框架和模型,这对于使AI代理能够理解和与物理世界互动至关重要。World in World 为视频世界模型提供了无需训练的灵活控制接口,而 WorldAgen 则专注于通过测试时训练将这些模型适应新环境。PAN 提出了一个用于通用、可操作和长时域模拟的世界模型架构,ActionSplice 介绍了一种在交互式世界模型中进行飞行中动作编辑的方法。此外,MaP-WAM 通过将规划与执行分离来增强…
-
LLM接地提案使用基于JEPA的世界模型进行物理模拟
一位Reddit用户提出了一种新颖的方法,通过在物理模拟中训练世界模型来接地大型语言模型(LLM)。该方法涉及使用联合嵌入预测架构(JEPA)在抽象嵌入空间中预测未来状态,该空间将编码物体持久性和动量等物理原理。然后,这个接地表示将被附加到LLM上,为其提供语言知识和直观的物理理解,从而可能加速下游学习。
-
Li Haoyi 加入 AMI Labs 开发 AI 世界模型
来自 Scala 社区的 Li Haoyi 已加入 AMI Labs,致力于开发 AI 的“世界模型”。这种方法旨在通过将大量输入数据预处理成嵌入(embeddings),使 AI 能够处理更多现实世界的问题,从而让 AI 专注于这些精炼的表示。这项工作涉及嵌入和 JEPA 架构等概念,预计在未来几年将变得越来越重要。
-
中国人形机器人推进将人工智能竞赛转向“世界模型” · 跟踪1个来源
中国正在加速人形机器人的研发,这正在重塑全球人工智能竞争格局。这种转变正聚焦于能够使机器掌握物理理解力的“世界模型”,这可能使中国在人工智能发展的下一阶段处于领先地位。中国主要科技公司和人工智能领导者都参与了这项推进。
-
LeFlow 引入可复用的潜在轨迹先验用于世界模型规划
研究人员推出了一种在潜在世界模型中进行规划的新方法 LeFlow。与需要为每个规划步骤进行迭代优化的传统方法不同,LeFlow 学习了一个可复用的潜在轨迹先验。这使得规划可以被构建为条件潜在轨迹生成,其中一个修正流模型将当前嵌入映射到目标嵌入,而一个逆动力学解码器将这些潜在转换翻译成动作序列。LeFlow 在多个基准测试中展示了持续的成功率提升和规划时间数量级的缩减。
-
新研究推动用于AI训练的外科手术视频生成
两篇最新的arXiv论文探讨了外科手术视频生成领域的进展,该领域对于在术中感知和机器人手术中训练AI模型至关重要。第一篇论文对2024-2026年的文献进行了调查,将方法分为无条件生成、条件生成和世界模型生成,并强调了向模拟因果动力学而非仅仅视觉逼真度的转变。第二篇论文介绍了一个新颖的框架,该框架将关节运动学转换为与图像对齐的控制模式,使用分层路由系统选择性地激活相关控制,以实现更精确高效的视频生成,并包含一个新的评估基准。