MuJoCo
PulseAugur coverage of MuJoCo — every cluster mentioning MuJoCo across labs, papers, and developer communities, ranked by signal.
8 天有情绪数据
-
新的图算子世界模型增强了机器人形态泛化能力
研究人员推出了一种新的结构化世界模型——图算子世界模型(GraphOp-WM),旨在提高关节机器人连续控制任务中跨不同形态参数的泛化能力。该模型将状态转移分解为与形态无关的动力学基础和与形态相关的算子,使其能够适应连杆长度和质量等参数的未见过的变化。实验在 MuJoCo 环境中,使用 Hopper、Walker2d 和 HalfCheetah 机器人进行,证明了 GraphOp-WM 在处理插值、外推和保留的参数组合方面的有效性。
-
中国团队 DeepSoma 旨在实现详细的大脑模拟和现实世界整合
中国初创公司智岳空间智能(Zhiyue Kongjian Intelligence)推出了 DeepSoma 平台,该平台旨在模拟详细的生物神经元模型,并将其与现实世界环境和各种物理实体相结合。与 Eon Systems 简化的数字果蝇不同,DeepSoma 专注于生物物理细节的神经模型构建,并将真实世界场景重构为可计算的 4D 数字世界。该平台设计用于在不同载体上运行相同的大脑模型,从数字动物到机械臂和人形机器人,旨在为具身人工智能…
-
FEAGINE发布柔性机器人身体和跨具身AI模型
由大疆前工程师彭蕊创立的机器人公司FEAGINE正在开发一种超越人形的具身智能新方法。FEAGINE不复制人体,而是将灵活的仿生机器人身体设计为一种变量,专注于它们在不同物理形态下适应和学习的能力。其第一代柔性机器人身体A01、A02和A03,设计长度、段数和自由度各不相同,并与其基础模型Fi0配对,旨在使机器人能够在不同的具身形态中重用学习到的技能和世界知识。
-
新的DClamp-PPO算法通过惩罚“错误”方向的更新来增强强化学习
研究人员推出了一种名为方向约束PPO(DClamp-PPO)的新型算法,旨在增强深度强化学习中近端策略优化(PPO)的性能。DClamp-PPO通过惩罚那些朝着“错误”方向更新的更新来解决现有PPO变体的一个关键限制,这种现象通常由策略优化随机性引起。新方法在这些有害区域强制执行更陡峭的损失斜率,旨在使重要性比率更接近1并防止过度优化。在各种MuJoCo环境中的实证结果表明,DClamp-PPO的性能始终优于标准PPO及其其他变体。
-
新的MINT方法在约束下优化多时间尺度干预
研究人员开发了一种名为MINT(多时间尺度干预网络训练)的新方法,以解决干预可能产生即时或持续影响的序贯决策问题。MINT使用增强的干预状态来管理这些影响,并采用结构化策略将干预模式选择与控制分离。这种方法保持了马尔可夫性质,并在表格Q学习实例中证明了收敛性。MINT在运动控制、库存管理和1型糖尿病模拟器的基准测试中表现出色,在指标性能和资源利用率方面均优于基线方法。
-
新方法将非线性动力学提炼为线性状态空间模型
研究人员开发了一种从非线性动力学系统学习线性状态空间模型的新颖流程。这种称为光谱蒸馏(Spectral Distillation)的方法,首先使用观测光谱滤波(Observation Spectral Filtering, OSF)通过凸优化方法学习隐式谱预测器。随后,该预测器被转换为显式的循环线性动力学系统。该方法在预测误差上提供了可证明的保证,其误差依赖于观测器复杂度而非潜在维度,并在线性基准和 MuJoCo 行为克隆的实验中证明了其有效性。
-
新框架和模拟工具应对不可避免的机器人故障
研究人员开发了一个新的安全框架,以解决在人类共享环境中运行的服务机器人中不可避免的故障问题。该框架量化了故障期间负面交互的可能性和严重性,使机器人能够在安全与任务效率之间取得平衡。为了促进该领域的研发,还创建了一个基于MuJoCo的模拟环境FailBench,支持在各种故障条件下研究机器人与环境的交互。
-
新的SO-OPF方法精确分析视觉编码器变化
研究人员开发了一种名为支持操作分解(SO-OPF)的新方法来分析冻结的视觉编码器,旨在精确识别编码器操作中的变化及其位置。该技术解决了“操作洗白”问题,即不同的操作可能被错误地归因于相同的分析槽。SO-OPF将编码器是否可以组合保留的绑定以及是否可以从简单标签中恢复该组合的问题分开。在Shapes3D-Extended和COCO数据集上使用DINOv3特征进行的实验显示了恢复因子分配的高准确性,但重建的MuJoCo基底揭示了局限性,表…
-
演化策略在持续AI控制任务中展现出潜力
研究人员探索了演化策略(ES)在持续控制任务中的应用,这类任务要求AI代理在适应新挑战的同时不丢失先前获得的知识。在连续MuJoCo运动任务上的实验表明,标准的ES方法会遭受严重的灾难性遗忘。研究发现,引入回放机制可显著提高知识保留能力并促进任务间的正向迁移,尽管更大的回放预算可能会降低可塑性。
-
像“MiMo”这样的模糊 API 请求需要结构化识别,以防止集成错误
文章讨论了当单个名称(如“MiMo”)可以指代多个不相关的产品时,API 请求的模糊性。它强调了一个常见的接收流程错误,即模糊地请求“MiMo AI API”被错误地视为一个完整的技术要求,导致在错误的服务上进行集成工作。作者提出了一个包含七个字段的结构化接收卡——名称、域、所有者、目的、文档、端点和状态——以清晰地识别正确的产品并防止浪费精力。
-
新的导管控制方法优先考虑安全性和跟踪
研究人员开发了一种新的可控导管控制方法,重点关注导管与组织之间交互的动力学。该方法使用部分物理前馈来抵消可靠的弯曲动力学,从而揭示了一个线性的交互动力学模型。然后,预测优化器在遵守接触力、腱力曲率硬约束的情况下调节此状态。该方法在模拟中进行了测试,显示出接近误差的显著减少,并且即使在模拟的心脏运动下,也能成功地将跟踪与力安全边界相协调。
-
新RL方法PGTT增强了腿式机器人地形穿越能力
研究人员开发了一种名为Phase-Guided Terrain Traversal (PGTT) 的新型强化学习方法,用于腿式机器人。该方法使用奖励塑形来强制执行步态结构,使策略可以直接在关节空间中运行并适应不同的机器人形态。与现有基线相比,PGTT在模拟环境中表现出更高的成功率,在处理干扰和障碍物方面也更优越。初步结果表明,该方法可以迁移到Unitree Go2和ANYmal-C等现实世界机器人上,只需进行少量重新调整。
-
新的PAMD方法增强了视觉强化学习算法
研究人员推出了一种新颖的成对自适应马氏距离(PAMD)方法,旨在改进视觉强化学习算法。该新方法参数化了一个正定的、成对条件化的度量,用于测量潜在状态相似性,为固定的全局范数提供了更具表现力和结构化的替代方案。在视觉MuJoCo连续控制任务上的实证验证表明,配备PAMD的双模拟基础的强化学习算法在多项任务上取得了显著的性能提升。
-
用于机器人手臂到达-避让任务的深度强化学习新基准
研究人员开发了一个新的机器人到达-避让任务基准,利用 MuJoCo MJX 物理引擎和 Brax 库进行并行化模拟和强化学习。该基准旨在捕捉现实世界的复杂性而不进行简化,解决了先前深度强化学习(DRL)智能体在简化环境中表现良好但在现实场景中失败的局限性。该研究在到达任务中实现了 UR5e 机器人 96.1% 和 Franka Emika 机器人 98.8% 的最先进成功率,在静态到达-避让任务中分别实现了 86.8% 和 95.2%…
-
AI触觉技术公司塔山科技获数亿元融资 · 追踪到1个来源
北京塔山科技有限公司(Tashan Technology)是一家专注于AI触觉感知的公司,已成功获得数亿元人民币的B轮融资。本轮融资由君石电子领投,并吸引了其他行业参与者。资金将用于推进其触觉传感器、芯片和训练平台的研发。塔山科技被认为是英伟达(NVIDIA)的首个全球触觉仿真合作伙伴,已开发出从芯片到应用解决方案的全栈技术体系,在蓬勃发展的具身智能(embodied AI)领域中,其定位为关键的基础设施提供商。
-
新的MAGIK框架支持RL智能体进行零样本知识迁移
研究人员开发了MAGIK,一个旨在增强强化学习(RL)智能体知识迁移能力的新框架。该系统使RL智能体能够在不直接与目标环境交互的情况下,将其从先前学习的任务中获得的知识应用于新的、类似的任务。MAGIK利用想象机制在任务之间映射实体,从而实现现有策略的重用。在MiniGrid和MuJoCo环境中进行的实验表明,MAGIK能够以最少的人工标注示例有效地实现零样本迁移,并且优于相关的基线方法。
-
苍蝇大脑拓扑结构启发了鲁棒的机器人导航神经网络
研究人员开发了一种名为FLYNN的新型循环神经网络,该网络直接模仿了果蝇大脑的神经结构。该网络在模拟环境中展现出强大的导航能力,其性能与同等规模的传统网络相当。值得注意的是,与传统网络不同的是,FLYNN在面对不熟悉的数据和感官剥夺时表现出更强的鲁棒性,即使在完全失去视觉输入的情况下也能保持功能。
-
新研究应对大语言模型对齐、安全和优化挑战
研究人员正在探索改进大语言模型(LLM)对齐和可靠性的新方法。一项研究发现字节对编码(BPE)分词中存在一个漏洞,该漏洞可能被利用来绕过安全机制,导致多个模型系列产生有害输出。另一篇论文提出了一个名为HAL的框架,通过优化明确的、可解释的对话特征来诱导大语言模型产生类似人类的对话行为。此外,一个名为Object Aligner的新库提供了一种可配置的方法来评估JSON模式相似度,这对于大语言模型提示优化和工具使用非常有用。最后,对大语…
-
新的AIDA框架用有限数据改进视觉强化学习
研究人员开发了AIDA(面向域自适应的自适应想象),一个旨在改进在目标数据有限场景下视觉强化学习的新框架。该方法通过生成可靠且语义化的“想象回放”来增强稀缺的真实世界数据,从而解决了从模拟到现实的迁移挑战。AIDA利用一个对分布偏移敏感的判别器来截断不可靠的转换,并利用自洽性损失来惩罚状态重建中的差异,从而学习更鲁棒的状态表示。
-
新研究重新审视复杂强化学习空间中的动作分解 · 跟踪到2个来源
一篇新的研究论文探讨了在强化学习中处理复杂动作空间的方法,特别是那些结合了离散动作和连续动作的动作空间。该研究分析了不同算法和环境中的各种分解技术,并引入了两个新的并行环境 CoopPush 和 Hybrid-Shoot 来促进这项研究。研究结果表明,分支对决架构在计算和性能之间取得了良好的平衡,而自回归动作(Auto-Regressive actions)取得了最高的整体性能,尽管原生连续 SAC 尽管计算成本更高,但表现更优。