π0.5
PulseAugur coverage of π0.5 — every cluster mentioning π0.5 across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
人形机器人通过新的VLA模型获得大语言模型驱动的“双手”
视觉-语言-动作(VLA)模型的最新进展旨在弥合大语言模型推理能力与机器人实时控制需求之间的差距。英伟达的GR00T N1.7、Google DeepMind的Gemini Robotics 1.5和Physical Intelligence的π0.5代表了应对这一挑战的不同架构方法。尽管它们都被营销为通用操作系统,但在整合感知、推理和动作方面存在差异:GR00T使用独立的网络,Gemini采用时间交错,而π0.5则试图在单个Tran…
-
具身智能公司竞相在世界人工智能大会上开发机器人触觉感知
在世界人工智能大会(WAIC)上,具身智能领域的公司越来越关注机器人的触觉感知。这种转变是由纯粹视觉感知在复杂操作任务中的局限性驱动的,在这些任务中,细微的接触信息至关重要。研究,例如涉及顶尖AI研究人员的“T-Rex”论文,表明集成触觉数据需要专门的模型和处理路径,而不仅仅是将其添加到现有的视觉系统中。
-
OpenBMB发布用于设备端机器人的MiniCPM-Robot模型
OpenBMB发布了两个新模型MiniCPM-RobotTrack和MiniCPM-RobotManip,专为机器人设备端AI设计。MiniCPM-RobotTrack专注于语言条件下的目标跟踪,利用融合的视觉特征预测未来航点,并实现高效的设备端推理。MiniCPM-RobotManip是一个更大、更通用的视觉-语言-动作模型,用于具身操作,性能优于其他模型,并具有流式上下文功能,可用于长视域决策并减少计算量。
-
新模型和框架推动具身AI能力发展
研究人员正在开发先进的模型和框架,以实现更具能力的具身人工智能。一种方法是Athena-Brain-8B,一个为设备端机器人大脑设计的8B LLM,展现出强大的通用智能和具身交互能力,并能给出简洁的响应。另一篇论文探讨了Edmund Berkeley和David L. Heiserman的历史工作,将其视为一个未被充分探索的具身智能架构,将逻辑与硬件和时间扩展行为联系起来。此外,一个1.5B的开源VLA模型MiniCPM-Robot,…
-
RoboDojo基准揭示AI机器人与人类表现的巨大差距
一项名为RoboDojo的新基准已发布,用于评估具身智能,包含42个模拟任务和18个真实世界机器人任务。该基准突显了当前AI模型与人类表现之间存在的巨大差距,在模拟环境中,最佳模型成功率仅为8.80%,在真实机器人上为12.8%,而人类的成功率分别为76.03%和100%。RoboDojo旨在为具身智能提供标准化和全面的评估,涵盖泛化能力、记忆、精度、长时序执行和开放式语义理解。
-
蚂蚁集团发布机器人开源模型LingBot-VLA 2.0 · 追踪2个来源
蚂蚁集团AI部门蚂蚁灵玎发布了LingBot-VLA 2.0,这是一个为复杂机器人任务设计的开源视觉-语言-动作(VLA)模型。新版本显著扩展了其训练数据至60,000小时,其中包含50,000小时的机器人轨迹数据和10,000小时的第一人称人类操作视频。LingBot-VLA 2.0支持来自17家制造商的20多种机器人配置,将其动作空间扩展到包括头部、腰部、末端执行器和移动基座,在物体操作和厨房清洁等任务中表现出改进的性能。
-
HIL-ResRL:AI机器人适配器1小时微调,成功率提升至95%
研究人员开发了HIL-ResRL,一种用于视觉-语言-动作(VLA)模型的新型适配器,能够对真实世界机器人任务进行快速、安全的微调。该系统使用轻量级的残差策略,并结合了人工干预(human-in-the-loop)来纠正错误,并将预训练的VLA模型适配到特定的工业环境中。在UR5e机器人手臂的测试中,HIL-ResRL在经过仅一小时的实时训练后,在抓取放置和插拔等任务上取得了超过95%的成功率,显著优于现有的强化学习基线,并通过最大限…
-
EBench 基准测试为机器人操作策略提供详细诊断
一项名为 EBench 的新基准测试已被引入,用于评估机器人领域中通用移动操作策略。与依赖单一成功率的先前基准测试不同,EBench 在 26 项任务以及多个能力和泛化维度上提供了详细的诊断概况。使用 EBench 进行的早期评估揭示了 π0.5、XVLA 和 InternVLA-A1 等最先进模型在性能上的显著差异,突出了先前被汇总分数掩盖的特定优势和劣势。这种详细分析旨在指导未来更强大、更具泛化性的机器人操作策略的开发。
-
Qwen-RobotManip 模型通过统一对齐技术推进机器人操作
研究人员开发了 Qwen-RobotManip,一个专为机器人操作设计的通用基础模型,该模型利用了统一的对齐框架。这种方法使模型能够有效地在包括人类视频和合成机器人轨迹在内的大规模、多样化数据集上进行训练,克服了以往异构操作数据的挑战。该模型展示了涌现的泛化能力,例如零样本指令遵循和跨具身迁移,在各种分布外基准测试中表现优于现有的最先进模型,并在真实机器人平台上展现出潜力。
-
VISTA框架通过验证数据改进机器人训练
研究人员开发了VISTA,一个旨在利用真实机器人数据改进视觉-语言-动作(VLA)模型训练的框架。该框架解决了相机视角失真和人类收集的轨迹在物理上不可行等挑战。VISTA包含一个新的数据集(UMI-VQA),用于处理失真的视觉输入,以及一个验证流程,用于过滤不安全或不可能的机器人动作,从而提高策略性能。
-
OpenGalaxea发布G0.5具身模型,赋能机器人“边思考边行动”
开源AI实验室OpenGalaxea发布了G0.5,这是一款新一代具身基础模型,旨在赋能机器人“边思考边行动”。该模型将推理和行动整合到单一架构中,使机器人能够执行具有零样本泛化能力的任务。G0.5采用统一的动作解码器和原生的动作思维链机制,使其能够分解长程任务并根据自然语言提示调整其行动。该模型还集成了时空注意力模块以增强上下文感知能力,并在各种基准测试中展示了最先进的性能。
-
基于17,800小时真实机器人数据训练的开源具身世界模型
研究人员推出了τ0-World Model (τ0-WM),这是一个开源的具身世界模型,在海量的30,000小时数据上进行了训练,其中大部分(17,800小时)来自真实机器人远程操作。该模型超越了预测未来状态的能力,通过引入测试时计算(Test-Time Computation),使机器人在执行前能够评估和选择最优动作,甚至纠正潜在错误。与之前的模型相比,τ0-WM在复杂操作任务上表现出更优异的性能,挑战了仅将真实世界数据用于微调的传统方法。