PulseAugur
实时 10:29:00
English(EN) G0.5: One Autoregressive Stream for Robot Reasoning and Action

G0.5模型将机器人推理与行动整合到单一流中

研究人员推出G0.5,这是一种新颖的自回归视觉-语言-行动(VLA)模型,它在一个Transformer解码器中整合了推理和行动生成。这种方法使VLM能够充当决策者,而不仅仅是上下文编码器。G0.5利用了一个可学习的行动分词器,用于共享的行动词汇表,一个用于交错推理和行动的思维链流,以及一个用于历史上下文的视觉记忆模块。该模型在七个不同的机器人基准测试中表现出最先进的性能,包括真实世界的机器人和长时程操作任务。 AI

影响 这种机器人推理与行动的集成方法可能导致在复杂环境中更强大、更适应的机器人系统。

排序理由 发表了一篇详细介绍新模型架构及其基准性能的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

G0.5模型将机器人推理与行动整合到单一流中

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Yicheng Liu, Zibin Dong, Baijun Ye, Tianyuan Yuan, Tao Jiang, Anqi Yang, Shicheng Cao, Haonan Liu, Yue Sun, Zihan Guo, Xiao Liu, Dong Ke, Changxun Pan, Chenru Wu, Tailai Cheng, Xiaoshu Ren, Xinlei Zhang, Jianning Cui, Zijie Zhao, Haoyu Zhang, Kaiming Xu,… ·

    G0.5:机器人推理与行动的单一自回归流

    arXiv:2608.11739v1 Announce Type: cross Abstract: The prevailing recipe for Vision-Language-Action (VLA) models couples a pretrained VLM with a separately trained flow-matching action expert. This makes the VLM a context encoder rather than a decision-maker. We introduce G0.5, a …