PulseAugur
中
实时 18:46:23
实体 Vision-language-action model

Vision-language-action model

PulseAugur coverage of Vision-language-action model — every cluster mentioning Vision-language-action model across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
63
90 天内 63
发布 · 30天
0
90 天内 0
论文 · 30天
58
90 天内 58
层级分布 · 90 天
主题
关系
情绪 · 30 天

7 天有情绪数据

最近 · 第 1/4 页 · 共 78 条
  1. TOOL · CL_284390 ·

    新方法引导AI导航避开看不见的危险

    研究人员开发了一种名为物理引导视觉提示(PG-VP)的新方法,以增强视觉-语言-动作(VLA)模型在安全关键环境中的导航能力。这个即插即用的模块允许VLA模型通过叠加虚拟障碍物来检测和导航避开看不见的危险,如辐射和高温,从而指导模型现有的导航策略。PG-VP已在模拟和现实世界测试中证明了其有效性,在无需重新训练模型的情况下显著提高了安全性。

  2. TOOL · CL_280184 ·

    FastOPD框架通过蒸馏实现轻量级VLA模型部署

    研究人员开发了FastOPD,一个用于部署轻量级视觉-语言-动作(VLA)模型的新框架。该方法使用On-Policy蒸馏将大型、计算成本高昂的VLA基础模型的知识转移到更小、更高效的学生模型中。FastOPD通过适配单状态教师监督的流图并结合自洽性目标来实现这一点,理论上使学生模型能够匹配理想的少步教师模型的性能。评估显示,在推理延迟和计算成本方面有显著降低,同时保留了原始模型性能的很高百分比,并且优于现有的蒸馏基线。

  3. TOOL · CL_273358 ·

    X-Planner系统通过事件结构化表征增强具身AI任务规划能力

    研究人员推出X-Planner,一个旨在改进具身人工智能任务规划的新系统。该系统通过使中间规划结构更加明确,解决了当前视觉-语言-动作(VLA)模型的局限性。X-Planner结合了真实机器人数据和共享的VLM骨干网络,提供了两种不同的规划表征:用于可解释事件状态的离散接口和用于连续推理的潜在接口。评估表明,X-Planner在规划质量和下游执行任务方面表现具有竞争力。

  4. RESEARCH · CL_273194 ·

    新基准测试多模态AI在3D世界中发现缺陷的能力

    研究人员推出了WorldAuditBench,这是一个旨在测试多模态智能体在交互式3D环境中识别异常能力的新基准。该基准使用Unreal Engine 5和Three.js构建,包含13个环境中的213个异常任务。对五个领先模型的评估显示,成功率远低于人类表现,凸显了这些智能体在系统性探索和异常检测中结合行动和视觉推理能力的当前局限性。

  5. TOOL · CL_259195 ·

    新论文对生成式物理人工智能方法进行分类

    一篇新的arXiv论文对生成式物理人工智能(GPAI)进行了全面综述。GPAI是将大型基础模型与物理机器人相结合的领域。该论文将GPAI系统分为五种方法:机器人基础模型(RFMs)、视觉-语言-动作(VLA)模型、大型行为模型(LBMs)、扩散策略模型(DPMs)和世界基础模型(WFMs)。文章详细介绍了这些方法如何结合以增强各行业的机器人应用,包括自动驾驶汽车和医疗保健,同时还强调了模拟到真实迁移和安全性等领域的研究方向。

  6. RESEARCH · CL_257133 ·

    新研究通过时间上下文和视觉前瞻性增强机器人操控能力 · 跟踪4个来源

    研究人员正在开发新方法,通过结合时间上下文和视觉前瞻性来改进机器人操控。PACT-WAM 使用紧凑的时间编码来预测动作轨迹和视觉结果,在各种任务上实现了高成功率,尤其是在增强了提案审查组件后。同样,TEMPO 通过增加运动摘要和本体感受历史来增强现有模型,以解决运动模糊和状态别名问题,从而解决了动态操控的局限性。另一种方法“Acting in Meters”引入了一个度量交互框架,该框架在物理空间中对物体和场景交互进行建模,以优化动作…

  7. RESEARCH · CL_249556 ·

    新框架通过流匹配和安全约束增强机器人策略 · 跟踪 4 个来源

    研究人员开发了几个新的框架来改进强化学习中的基于流的策略,特别是在机器人领域。这些方法旨在解决多模态动作分布和需要安全、符合约束的动作等挑战。诸如基于精炼的流策略优化 (RFPO) 和 OptiFlow 等技术利用值引导和最优传输来更好地表示复杂的动作空间并避免模式崩溃。另一种方法,值引导流匹配 (VGFM),将值引导直接集成到流匹配过程中,而无需复杂反向传播。此外,ActSafeGuard 引入了一个可微分的安全卫士层,以确保机器人…

  8. TOOL · CL_254019 ·

    MobileVLA-R1 2.0 通过推理和强化学习提升机器人指令遵循能力

    研究人员推出了 MobileVLA-R1 2.0,一个旨在增强移动机器人遵循复杂、长时程指令能力的新框架。该系统集成了结构化推理、强化学习和思维链对齐,以弥合高级理解与低级机器人控制之间的差距。在包括 Unitree Go2 和 G1 机器人的导航和操作等各种任务上的评估显示,与先前版本相比有了显著改进,尤其是在真实世界的移动操作场景中。

  9. TOOL · CL_235608 ·

    新的EGR方法提高了机器人策略在传感器问题上的鲁棒性

    研究人员开发了一种名为证据门控正则化(EGR)的新训练目标,以提高机器人视觉-语言-动作(VLA)策略的鲁棒性。该方法解决了模态纠缠问题,即策略从有限数据中学习到虚假关联,导致在传感器损坏或不可用时性能下降。EGR根据每帧和每种传感器的任务相关性来门控一致性目标,在模拟和真实机器人环境中均显示出显著的改进。

  10. RESEARCH · CL_239342 ·

    新的RoboSPA基准测试VLA模型在复杂机器人推理能力

    研究人员推出了RoboSPA,这是一个新的数据集和基准,旨在评估机器人领域中视觉语言动作(VLA)模型具身推理能力。RoboSPA专注于细粒度的空间推理和长时序程序规划,呈现出跨越多个难度级别和具身形式、复杂度递增的任务。对当前VLA模型的初步实验表明,在处理复杂空间关系、精确执行和内存密集型规划方面存在显著挑战,凸显了对更先进具身智能体的需求。

  11. TOOL · CL_229599 ·

    新的RedLight-VLA模型增强了交叉路口的AI驾驶策略

    研究人员开发了RedLight-VLA,一种新颖的训练目标,旨在提高视觉-语言-动作(VLA)驾驶策略的性能,尤其是在信号交叉路口等复杂场景中。该目标结合了轨迹推导的行为重加权,以强调罕见机动,并辅以显式监督交通灯和停车线状态的辅助头。评估表明,RedLight-VLA显著减少了停车线定位和速度方面的错误,同时提高了整体轨迹预测精度。

  12. TOOL · CL_221350 ·

    新的潜在空间推理模型增强了端到端的自动驾驶能力

    研究人员推出了一种名为 Latent Chain-of-Thought-Drive (LCDrive) 的新型端到端自动驾驶方法,该方法使用潜在语言进行推理,而非自然语言。该模型将动作建议令牌与基于学习到的潜在空间的世界模型令牌交织在一起,以预测驾驶动作的未来结果。初始训练由地面真实未来轨迹进行监督,然后进行闭环强化学习。在大型驾驶基准测试中,与非推理和基于文本的推理基线相比,LCDrive 表现出更快的推理速度、更高的轨迹质量以及从…

  13. RESEARCH · CL_215874 ·

    新研究探索用于大型语言模型推测性解码的并行草稿

    两篇新研究论文探讨了大型语言模型推测性解码的进展,重点关注提高并行草稿的效率和连贯性。第一篇论文调查了块并行推测性解码在多模态模型中的适用性,分析了各种架构和基准。第二篇论文介绍了 LiLiCorr,这是一种轻量级方法,通过关联并行草稿的似然性来增强连贯性和接受率,展示了比现有方法显著的吞吐量改进。

  14. RESEARCH · CL_208598 ·

    新方法增强机器人领域 VLA 策略的效率和鲁棒性 · 跟踪 4 个来源

    研究人员开发了新方法来提高机器人领域视觉-语言-动作 (VLA) 策略的效率和鲁棒性。一种方法 EXIMO 使用视觉-语言模型 (VLM) 作为规划器,将复杂任务分解为更小的步骤,从而实现更高效的微调和数据收集。另一种方法 GS-VLA 采用高斯溅射技术,在无需重新训练的情况下使冻结的 VLA 策略适应视角变化,显著提高了性能鲁棒性。此外,Prism-GRPO 通过纳入轨迹级别的执行质量分数来增强策略优化,减少了对大量机器人滚动的需求…

  15. TOOL · CL_206117 ·

    SpecVLA框架提升具身AI中VLA模型的效率

    研究人员开发了SpecVLA,一个用于协同设计算法和硬件架构的新框架,以提高具身AI中视觉-语言-动作(VLA)模型的效率。该方法利用了机器人环境在活跃和非活跃状态之间交替的观察,从而在非活跃期间进行推测性的长动作长度预测,并在活跃期间进行选择性验证。SpecVLA包括一个算法侧执行范式和一个较小的验证模型(sVLA),以及一个具有并行执行能力的系统侧异构架构。在LIBERO和ManiSkill等基准测试上的评估表明,SpecVLA在…

  16. TOOL · CL_198077 ·

    G0.5模型将机器人推理与行动整合到单一流中

    研究人员推出G0.5,这是一种新颖的自回归视觉-语言-行动(VLA)模型,它在一个Transformer解码器中整合了推理和行动生成。这种方法使VLM能够充当决策者,而不仅仅是上下文编码器。G0.5利用了一个可学习的行动分词器,用于共享的行动词汇表,一个用于交错推理和行动的思维链流,以及一个用于历史上下文的视觉记忆模块。该模型在七个不同的机器人基准测试中表现出最先进的性能,包括真实世界的机器人和长时程操作任务。

  17. TOOL · CL_193271 ·

    新基准和VLA模型推动合作自动驾驶研究

    研究人员推出了CMU-Drive,这是一个用于评估多个联网车辆之间合作自动驾驶能力的新基准。在此基准的基础上,他们提出了V2V-VLA,一个专为合作驾驶场景设计的视觉-语言-动作模型。该模型将合作感知、推理和规划整合到一次前向传播中,生成驾驶动作、未来航点和基于语言的推理。目标是推进多智能体、闭环、端到端合作自动驾驶的研究,并将公开发布代码和模型检查点。

  18. TOOL · CL_191363 ·

    新的自适应VLA框架通过环境感知模型选择增强具身智能

    研究人员开发了一个名为环境感知模型选择(EMS)的新框架,用于具身智能,该框架可以自适应地在两个不同的视觉-语言-动作(VLA)系统之间切换。这种方法将快速响应系统与慢速深思熟虑系统解耦,实现了模块化和灵活的系统替换。自适应切换策略根据实时反馈动态选择使用哪个系统,平衡了预训练知识的利用和运行时效率。EMS在LIBERO基准测试上已证明与更大的基线相当的成功率,同时显著提高了有效动作频率,并展示了在实际操作任务中的可扩展性。

  19. TOOL · CL_187303 ·

    新的SkillMemo框架增强了机器人操作的泛化能力

    研究人员开发了SkillMemo,一个旨在提高机器人领域具身视觉-运动模型组合泛化能力的新型框架。该框架解决了当前模型受限于大规模轨迹数据集稀缺性的局限性。SkillMemo将长时程演示隐式分解为原子技能,并将这些技能级别的特征整合到动态记忆库中,以解决复杂任务。实验表明,SkillMemo增强了Diffusion Policy和Vision-Language-Action等现有模型,取得了最先进的性能,并展示了对未见过的任务配置的强大泛化能力。

  20. TOOL · CL_185328 ·

    新的RESample框架通过失败恢复数据改进机器人操作

    研究人员开发了RESample,一个新颖的数据增强框架,旨在提高视觉-语言-动作(VLA)模型在机器人操作任务中的性能。该框架通过主动补充包含失败模式和后续恢复动作的轨迹来解决分布偏移和失败恢复问题。通过训练一个覆盖函数来识别数据分布中缺失的失败案例,RESample指导探索性采样来生成这些关键轨迹。在LIBERO基准和真实机器人任务上的实验表明,RESample显著提高了策略成功率,在训练数据适度增加的情况下,绝对增幅高达12%。