PulseAugur
实时 16:00:44

新的WALL-WM模型通过基于事件的预训练重新定义视频动作学习

研究人员推出了一种新颖的世界动作模型WALL-WM,它重新构建了视频动作学习。WALL-WM不优化固定长度的动作片段,而是利用基于事件的视觉-语言-动作预训练,将语义上连贯的动作事件作为基本单元。这种方法通过对齐语言、视觉和动作的时间尺度,解决了现有模型中的粒度不匹配问题。实验表明,WALL-WM在真实世界泛化评估中取得了最先进的性能。 AI

影响 引入了视频动作学习的新范例,可能改进机器人控制和自主系统。

排序理由 该集群包含一篇详细介绍新模型及其方法的学术论文。

在 Hugging Face Daily Papers 阅读 →

AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →

新的WALL-WM模型通过基于事件的预训练重新定义视频动作学习

报道来源 [3]

  1. Hugging Face Daily Papers TIER_1 English(EN) ·

    WALL-WM:在事件节点上进行世界动作建模

    WALL-WM is a World Action Model that shifts video-action learning from chunk-centric optimization to event-grounded Vision-Language-Action pretraining, using semantically coherent action events as the atomic unit of learning. Existing WAMs commonly initialize from multimodal or v…

  2. Hugging Face Daily Papers TIER_1 English(EN) ·

    WALL-WM: 在事件节点上进行世界动作建模

    WALL-WM advances video-action learning by using semantic events as learning units instead of fixed action chunks, enabling more flexible and scalable vision-language-action training and inference.

  3. arXiv cs.CV TIER_1 English(EN) · Shalfun Li, Victor Yao, Charles Yang, Truth Qu, Regis Cheng, Ryan Yu, Howard Lu, Newton Von, Vincent Chen, Yohann Tang, Maeve Zhang, Ellie Ma, Gody Li, Sage Yang, Lorien Shu, J. W. Gao, Ethan Chen, Colin Ye, Yu Sun, Elise Mon, PS Zhang, Neo Li, Lily Li, … ·

    WALL-WM:在事件节点上进行世界动作建模

    arXiv:2606.01955v1 Announce Type: cross Abstract: WALL-WM is a World Action Model that shifts video-action learning from chunk-centric optimization to event-grounded Vision-Language-Action pretraining, using semantically coherent action events as the atomic unit of learning. Exis…