研究人员推出G0.5,这是一种新颖的自回归视觉-语言-行动(VLA)模型,它在一个Transformer解码器中整合了推理和行动生成。这种方法使VLM能够充当决策者,而不仅仅是上下文编码器。G0.5利用了一个可学习的行动分词器,用于共享的行动词汇表,一个用于交错推理和行动的思维链流,以及一个用于历史上下文的视觉记忆模块。该模型在七个不同的机器人基准测试中表现出最先进的性能,包括真实世界的机器人和长时程操作任务。 AI
影响 这种机器人推理与行动的集成方法可能导致在复杂环境中更强大、更适应的机器人系统。
排序理由 发表了一篇详细介绍新模型架构及其基准性能的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- BEHAVIOR Challenge
- DROID
- GR00T-N1.7
- LIBERO
- R1lite
- R1pro
- RoboTwin 2.0
- SimplerEnv-Bridge
- Transformer Decoder
- Vision-Language-Action
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →