GR00T-N1.7
PulseAugur coverage of GR00T-N1.7 — every cluster mentioning GR00T-N1.7 across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
乐居机器人推出KUAVO VLA,通过专业具身AI提升工业效率
乐居机器人发布了KUAVO VLA,这是一款专为工业应用设计的专业具身智能模型。该模型使用KUAVO机器人超过600小时的真实世界数据进行“中期训练”,专注于工业共性和本体适应性。该方法旨在弥合通用基础模型与特定任务训练之间的差距,据报道,在某些工业场景下效率可提高约一倍,并在基准任务的成功率和过程得分方面均获得第一名。
-
G0.5模型将机器人推理与行动整合到单一流中
研究人员推出G0.5,这是一种新颖的自回归视觉-语言-行动(VLA)模型,它在一个Transformer解码器中整合了推理和行动生成。这种方法使VLM能够充当决策者,而不仅仅是上下文编码器。G0.5利用了一个可学习的行动分词器,用于共享的行动词汇表,一个用于交错推理和行动的思维链流,以及一个用于历史上下文的视觉记忆模块。该模型在七个不同的机器人基准测试中表现出最先进的性能,包括真实世界的机器人和长时程操作任务。
-
PhyAI引擎统一边缘和云端的物理AI推理
研究人员开发了PhyAI,这是一个统一的推理引擎,旨在简化物理AI模型在各种平台上的部署,包括边缘设备和云环境。这个单一运行时旨在保持一致的检查点和动作语义,同时通过特定模型的适配器优化性能。PhyAI在几种视觉-语言-动作和世界-动作模型上展示了比现有实现显著的速度提升,尽管在某些配置下专用运行时可能仍提供更优越的性能。该引擎的架构允许在GPU上高效执行,详细的性能分析揭示了与延迟和不同模型生成主导相关的性能瓶颈。
-
新的 $\pi\mathbf{R}^2$ 方法提高了 AI 策略的反应性和实时控制能力
研究人员开发了一种名为 $\pi\mathbf{R}^2$ 的新方法,可增强大规模操作策略的反应性。该方法解决了感知到行动管道中的延迟问题,使策略能够更有效地对实时感官输入做出反应。$\pi\mathbf{R}^2$ 通过将条件分解为快速和慢速通道,并适应不同的硬件延迟来实现这一点,从而在动态控制任务中实现更快的重新规划和更高的成功率。
-
RoboDojo基准揭示AI机器人与人类表现的巨大差距
一项名为RoboDojo的新基准已发布,用于评估具身智能,包含42个模拟任务和18个真实世界机器人任务。该基准突显了当前AI模型与人类表现之间存在的巨大差距,在模拟环境中,最佳模型成功率仅为8.80%,在真实机器人上为12.8%,而人类的成功率分别为76.03%和100%。RoboDojo旨在为具身智能提供标准化和全面的评估,涵盖泛化能力、记忆、精度、长时序执行和开放式语义理解。
-
蚂蚁集团发布机器人开源模型LingBot-VLA 2.0 · 追踪2个来源
蚂蚁集团AI部门蚂蚁灵玎发布了LingBot-VLA 2.0,这是一个为复杂机器人任务设计的开源视觉-语言-动作(VLA)模型。新版本显著扩展了其训练数据至60,000小时,其中包含50,000小时的机器人轨迹数据和10,000小时的第一人称人类操作视频。LingBot-VLA 2.0支持来自17家制造商的20多种机器人配置,将其动作空间扩展到包括头部、腰部、末端执行器和移动基座,在物体操作和厨房清洁等任务中表现出改进的性能。
-
LeRobot v0.6.0 增加了世界模型、新的 VLA 和改进的数据集
LeRobot v0.6.0 已发布,在机器人 AI 领域取得了重大进展。此次更新引入了 VLA-JEPA、FastWAM 和 LingBot-VA 等新的世界模型策略,使机器人能够“想象”未来的场景。它还通过 GR00T N1.7 和 MolmoAct2 等多个新的视觉-语言-动作 (VLA) 模型扩展了模型库,并引入了用于奖励模型的新 API。数据集管道的增强功能包括更快的加载和深度支持,以及新的模拟基准和改进的训练能力。
-
日本测试由NVIDIA GR00T驱动的老年护理人形机器人
日本已开始对Enactic人形机器人进行首次验证,该机器人专为老年护理设计。该机器人利用NVIDIA的GR00T N1.7平台,表明其专注于先进的人工智能能力以实现实际应用。该计划旨在将复杂的人工智能和机器人技术整合到医疗保健领域。
-
OpenGalaxea发布G0.5具身模型,赋能机器人“边思考边行动”
开源AI实验室OpenGalaxea发布了G0.5,这是一款新一代具身基础模型,旨在赋能机器人“边思考边行动”。该模型将推理和行动整合到单一架构中,使机器人能够执行具有零样本泛化能力的任务。G0.5采用统一的动作解码器和原生的动作思维链机制,使其能够分解长程任务并根据自然语言提示调整其行动。该模型还集成了时空注意力模块以增强上下文感知能力,并在各种基准测试中展示了最先进的性能。