PulseAugur
实时 07:49:17
实体 Vision-language-action model

Vision-language-action model

PulseAugur coverage of Vision-language-action model — every cluster mentioning Vision-language-action model across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
15
90 天内 66
发布 · 30天
0
90 天内 0
论文 · 30天
14
90 天内 54
层级分布 · 90 天
主题
关系
情绪 · 30 天

13 天有情绪数据

最近 · 第 1/4 页 · 共 66 条
  1. RESEARCH · CL_215874 ·

    新研究探索用于大型语言模型推测性解码的并行草稿

    两篇新研究论文探讨了大型语言模型推测性解码的进展,重点关注提高并行草稿的效率和连贯性。第一篇论文调查了块并行推测性解码在多模态模型中的适用性,分析了各种架构和基准。第二篇论文介绍了 LiLiCorr,这是一种轻量级方法,通过关联并行草稿的似然性来增强连贯性和接受率,展示了比现有方法显著的吞吐量改进。

  2. RESEARCH · CL_208598 ·

    新方法增强机器人领域 VLA 策略的效率和鲁棒性 · 跟踪 4 个来源

    研究人员开发了新方法来提高机器人领域视觉-语言-动作 (VLA) 策略的效率和鲁棒性。一种方法 EXIMO 使用视觉-语言模型 (VLM) 作为规划器,将复杂任务分解为更小的步骤,从而实现更高效的微调和数据收集。另一种方法 GS-VLA 采用高斯溅射技术,在无需重新训练的情况下使冻结的 VLA 策略适应视角变化,显著提高了性能鲁棒性。此外,Prism-GRPO 通过纳入轨迹级别的执行质量分数来增强策略优化,减少了对大量机器人滚动的需求…

  3. TOOL · CL_206117 ·

    SpecVLA框架提升具身AI中VLA模型的效率

    研究人员开发了SpecVLA,一个用于协同设计算法和硬件架构的新框架,以提高具身AI中视觉-语言-动作(VLA)模型的效率。该方法利用了机器人环境在活跃和非活跃状态之间交替的观察,从而在非活跃期间进行推测性的长动作长度预测,并在活跃期间进行选择性验证。SpecVLA包括一个算法侧执行范式和一个较小的验证模型(sVLA),以及一个具有并行执行能力的系统侧异构架构。在LIBERO和ManiSkill等基准测试上的评估表明,SpecVLA在…

  4. TOOL · CL_198077 ·

    G0.5模型将机器人推理与行动整合到单一流中

    研究人员推出G0.5,这是一种新颖的自回归视觉-语言-行动(VLA)模型,它在一个Transformer解码器中整合了推理和行动生成。这种方法使VLM能够充当决策者,而不仅仅是上下文编码器。G0.5利用了一个可学习的行动分词器,用于共享的行动词汇表,一个用于交错推理和行动的思维链流,以及一个用于历史上下文的视觉记忆模块。该模型在七个不同的机器人基准测试中表现出最先进的性能,包括真实世界的机器人和长时程操作任务。

  5. TOOL · CL_193271 ·

    新基准和VLA模型推动合作自动驾驶研究

    研究人员推出了CMU-Drive,这是一个用于评估多个联网车辆之间合作自动驾驶能力的新基准。在此基准的基础上,他们提出了V2V-VLA,一个专为合作驾驶场景设计的视觉-语言-动作模型。该模型将合作感知、推理和规划整合到一次前向传播中,生成驾驶动作、未来航点和基于语言的推理。目标是推进多智能体、闭环、端到端合作自动驾驶的研究,并将公开发布代码和模型检查点。

  6. TOOL · CL_191363 ·

    新的自适应VLA框架通过环境感知模型选择增强具身智能

    研究人员开发了一个名为环境感知模型选择(EMS)的新框架,用于具身智能,该框架可以自适应地在两个不同的视觉-语言-动作(VLA)系统之间切换。这种方法将快速响应系统与慢速深思熟虑系统解耦,实现了模块化和灵活的系统替换。自适应切换策略根据实时反馈动态选择使用哪个系统,平衡了预训练知识的利用和运行时效率。EMS在LIBERO基准测试上已证明与更大的基线相当的成功率,同时显著提高了有效动作频率,并展示了在实际操作任务中的可扩展性。

  7. TOOL · CL_187303 ·

    新的SkillMemo框架增强了机器人操作的泛化能力

    研究人员开发了SkillMemo,一个旨在提高机器人领域具身视觉-运动模型组合泛化能力的新型框架。该框架解决了当前模型受限于大规模轨迹数据集稀缺性的局限性。SkillMemo将长时程演示隐式分解为原子技能,并将这些技能级别的特征整合到动态记忆库中,以解决复杂任务。实验表明,SkillMemo增强了Diffusion Policy和Vision-Language-Action等现有模型,取得了最先进的性能,并展示了对未见过的任务配置的强大泛化能力。

  8. TOOL · CL_185328 ·

    新的RESample框架通过失败恢复数据改进机器人操作

    研究人员开发了RESample,一个新颖的数据增强框架,旨在提高视觉-语言-动作(VLA)模型在机器人操作任务中的性能。该框架通过主动补充包含失败模式和后续恢复动作的轨迹来解决分布偏移和失败恢复问题。通过训练一个覆盖函数来识别数据分布中缺失的失败案例,RESample指导探索性采样来生成这些关键轨迹。在LIBERO基准和真实机器人任务上的实验表明,RESample显著提高了策略成功率,在训练数据适度增加的情况下,绝对增幅高达12%。

  9. TOOL · CL_186967 ·

    DyPES-VLA模型增强了机器人跨不同具身的操作能力

    研究人员推出了一种新颖的视觉-语言-动作(VLA)模型DyPES-VLA,旨在提高机器人跨不同具身的操作能力。该模型通过从多样化数据中学习共享动力学先验,并使用具身特定的专家混合(MoE)动作头,解决了当前VLA方法的局限性。这使得DyPES-VLA能够在无需手动转换动作格式的情况下,将共享先验转换为各种机器人的原生动作空间,并在LIBERO、RoboCasa-GR1和RoboTwin 2.0等基准测试中取得了最先进的性能。

  10. RESEARCH · CL_181082 ·

    新的视觉语言模型技术提高了自动驾驶的推理能力和效率

    研究人员正在开发用于自动驾驶的视觉语言模型(VLM)的新方法,以提高推理能力并减少幻觉。一种方法 DEFT-RLVR 通过使未来轨迹成为验证目标而非预决策锚点来解决轨迹锚定偏差,从而实现更忠实的推理。另一种方法 TALSC 侧重于通过考虑传感器数据的及时性来优化大型和小型视觉语言模型在基础设施辅助自动驾驶中的协作。此外,MoRAL 提出了一种紧凑型视觉语言模型方法,该方法将推理与传感器数据相结合,从而在边缘设备上实现高效可靠的空间推理。

  11. TOOL · CL_189032 ·

    新的VLAGuard框架增强了机器人防御物理注意力劫持的能力

    研究人员开发了VLAGuard,一个旨在保护在无线传感器网络中作为移动边缘节点的视觉-语言-动作(VLA)机器人免受物理对抗性攻击的框架。该框架包括一个名为VASA的压力测试模块,该模块使用可打印的补丁来干扰机器人的注意力机制。为了应对这些攻击,VLAGuard采用了注意力保护微调(APFT),这是一种在不增加推理开销的情况下增强注意力和几何一致性的防御方法。评估表明,APFT显著提高了VLA机器人的性能,在模拟中降低了故障率,并在实…

  12. SIGNIFICANT · CL_173007 ·

    Google DeepMind 发布 Gemini Robotics 2,用于打造适应性强的机器人

    Google DeepMind 推出了 Gemini Robotics 2,这是一个旨在为适应性强的机器人提供动力的智能层。这个新系统包括一个具身推理模型 Gemini Robotics ER 2,它充当机器人的高级大脑。它与视觉-语言-动作模型协同工作,使机器人能够观察、推理、执行复杂的多步任务、自我纠正并适应新颖的情况。

  13. RESEARCH · CL_167890 ·

    新的DeVA模型通过解耦的视频-动作方法增强机器人策略学习 · 已追踪2个来源

    研究人员开发了DeVA,一种新的解耦视频-动作模型,旨在改进机器人策略学习。DeVA将视频和动作预测分离为专门的专家,从而实现更丰富的信息交换和更易于处理的策略适应。该模型结合了物理显著性引导,如可供性(affordance)和深度,来监督中间视频特征和动作流。实验表明,DeVA在有限数据下表现强劲,比统一架构收敛更快,并展示了其物理引导方法的明显优势。

  14. TOOL · CL_166995 ·

    新基准 MulRobBench 测试无人机代理的安全和安保策略决策

    研究人员推出 MulRobBench,这是一个旨在评估智能城市环境中多模态无人机 (UAV) 代理的新基准。该基准侧重于决策,整合了真实的无人机观测、安全策略和网络物理安全约束。MulRobBench 旨在评估这些代理在退化条件和模糊指令下的运行能力,将语义评分与策略合规性和不安全行为识别等结构性诊断相结合。初步评估显示,即使是表现最好的多模态模型,语义协议-决策得分也仅为 0.5141,凸显了在实现自主无人机可信决策方面存在的重大挑战。

  15. RESEARCH · CL_147860 ·

    Action QFormer 通过塑造多模态表示来增强 VLA 模型

    研究人员推出 Action QFormer,一种通过将动作监督视为表示塑造机制而非仅仅下游目标来增强视觉-语言-动作 (VLA) 模型的新方法。该方法利用指令条件查询来重组多模态信息,创建与动作兼容的表示,而不会破坏语言处理或对象基础。在零样本 sim-to-real 导航任务中,Action QFormer 将闭环任务成功率从 18.8% 提高到 56.3%,将动作生成正确率从 22.5% 提高到 75.5%,同时还减少了分布外生成。

  16. RESEARCH · CL_147411 ·

    RoboTTT 将机器人策略上下文扩展至 8K 时间步长,以增强模仿和长时任务 · 跟踪 3 个来源

    研究人员开发了 RoboTTT,这是一种新颖的训练方法和机器人模型,可将视觉运动上下文窗口显著扩展到 8000 个时间步长。这一进步使机器人能够从人类演示中进行一次性模仿,实时改进策略,并更有效地处理长时任务。在实际操作测试中,RoboTTT 的性能比单步上下文基线提高了 87%,并成功完成了一项复杂的多阶段装配任务。

  17. RESEARCH · CL_145638 ·

    机器人VLA模型通过语义锚定技术得到改进 · 已追踪2个来源

    研究人员开发了一种名为“语义锚定”的新方法,以提高机器人视觉-语言-动作(VLA)模型的性能。这些模型在有限的机器人演示上进行微调时,常常会丢失其丰富的语义理解。新技术将动作表征锚定到语义流形上,保留了从预训练的视觉-语言模型中学到的结构。该方法显示出显著的改进,在实际机器人应用中,在分布内任务上的成功率提高了高达18.7%,在分布外泛化能力上提高了21.5%。

  18. RESEARCH · CL_147882 ·

    新模型RxBrain和GTA-VLA推动具身AI推理发展

    研究人员推出了RxBrain,一个新颖的具身认知基础模型,它整合了语言和视觉推理能力以进行规划。与专注于场景理解或未来状态预测的现有模型不同,RxBrain将具身计划表示为一个统一的序列,利用语言来提供抽象结构,并利用视觉想象来 grounding 在物理状态中。该模型采用了Transformer混合架构,即使在没有大量动作数据预训练的情况下,在连续机器人动作生成方面也表现出有希望的性能。此外,还提出了一个名为GTA-VLA的新框架,…

  19. COMMENTARY · CL_143165 ·

    AI Agent:用视觉-语言-动作模型定义机器人技术的未来

    AI Agent被定义为能够感知、决策、行动并追求目标的实体,通过使用工具和反馈循环与简单的聊天机器人区分开来。这个框架对于开发能够理解和与物理世界交互的机器人至关重要。视觉-语言-动作(VLA)Agent集成了视觉感知、语言推理和运动控制,对于机器人技术尤其重要,使它们能够将高级指令和视觉输入转化为物理动作。

  20. TOOL · CL_131778 ·

    Nomagic部署AI‘大脑’用于仓库机器人,干预率减半

    Nomagic已成功将其首个视觉-语言-动作(VLA)模型部署给付费客户,标志着将AI应用于现实世界机器人任务方面迈出了重要一步。这个由前Google DeepMind研究员Markus Wulfmeier领导的仓库机器人AI‘大脑’,据报道在其客户Brack.Alltron的实际运营中,将机器人引起的干预率降低了一半。尽管尚未达到完美可靠性,Nomagic的方法侧重于开箱即用的任务特定掌握,并设计了一个确保安全并逐步提高AI能力的系统。