研究人员推出了RxBrain,一个新颖的具身认知基础模型,它整合了语言和视觉推理能力以进行规划。与专注于场景理解或未来状态预测的现有模型不同,RxBrain将具身计划表示为一个统一的序列,利用语言来提供抽象结构,并利用视觉想象来 grounding 在物理状态中。该模型采用了Transformer混合架构,即使在没有大量动作数据预训练的情况下,在连续机器人动作生成方面也表现出有希望的性能。此外,还提出了一个名为GTA-VLA的新框架,用于交互式具身推理,允许用户通过明确的视觉线索来指导机器人策略,以提高性能并促进故障恢复。 AI
影响 具身AI的这些进展可能带来更强大的机器人和智能体,使它们能够更好地理解和与物理世界互动。
排序理由 该集群描述了介绍具身AI新模型和框架的研究论文。
在 Hugging Face Daily Papers 阅读 →
- arXiv
- Hy-Embodied-RxBrain
- Mixture-of-Transformers
- RxBrain
- RxBrain-Bench
- Hugging Face
- GTA-VLA
- iFLYTEK-Embodied-Omni
- Qwen-RobotWorld
- Qwen-VLA
- ThinkingVLA
- Vision-Language-Action model
AI 生成摘要 · Google Gemini · 来自 4 个来源。 我们如何撰写摘要 →