π0.5
PulseAugur coverage of π0.5 — every cluster mentioning π0.5 across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
新的RoboSPA基准测试VLA模型在复杂机器人推理能力
研究人员推出了RoboSPA,这是一个新的数据集和基准,旨在评估机器人领域中视觉语言动作(VLA)模型具身推理能力。RoboSPA专注于细粒度的空间推理和长时序程序规划,呈现出跨越多个难度级别和具身形式、复杂度递增的任务。对当前VLA模型的初步实验表明,在处理复杂空间关系、精确执行和内存密集型规划方面存在显著挑战,凸显了对更先进具身智能体的需求。
-
Li 和 Wu 推出 TrAct 以统一机器人控制和视觉预测
研究人员(包括 Fei-Fei Li 和 Jiajun Wu)推出 TrAct,这是一种弥合机器人控制与视觉预测之间差距的新方法。TrAct 利用“视觉轨迹”作为中间语言,将机器人特定的“动作方言”翻译成世界模型可理解的通用“图像语言”。该系统包含三个组件:VLAT 用于生成动作-轨迹对,TWM 基于这些轨迹进行视觉预测渲染,VLAC 根据任务目标对预测进行评分。通过在机器人和人类第一人称视频的混合数据上进行训练,TrAct 旨在提高…
-
前华为“天才少年”李博杰谈AI创业与职业生涯
前华为“天才少年”李博杰公开分享了他的经历,包括一次病毒式传播的采访事件以及他的创业历程。他联合创立了AI代理公司Metagent,该公司在商业模式上面临挑战后,转向图像生成,之后又转向Pine AI,专注于解决海外日常纠纷。尽管最初对其才华和成就存在误解,李博杰现在作为首席科学家为Pine AI做出贡献,利用他在AI代理和复杂问题解决等领域的专业技术。
-
StreamPI框架赋予VLA模型对物理世界的时序理解能力
来自大笑机器人和香港大学的研究人员推出StreamPI,一个旨在赋予视觉-语言-动作(VLA)模型对物理世界时序理解能力的新型框架。与依赖单帧观测进行决策的传统VLA模型不同,StreamPI建立了连续的多模态时序上下文,使机器人能够记忆过去的状态,理解变化,并利用跨帧信息来增强感知和行动。这一进展使VLA模型超越了识别当前状态,能够理解正在进行的物理过程,为具身基础模型迈向连续物理智能提供了新的技术路径。
-
新的SoftVTBench数据集评估可变形物体操作中的物理交互
研究人员推出了SoftVTBench,这是一个新的数据集和基准,旨在评估可变形物体操作中物理交互的质量。该数据集将视觉观察与触觉数据配对,从而更全面地了解机器人策略如何与软体物体交互。该基准不仅衡量任务完成情况,还衡量物体变形的程度,揭示了当前策略在任务中常常成功,但仍会导致过度变形。
-
GigaBrain-0.7 凭借新架构和海量预训练推动具身人工智能发展
研究人员推出了 GigaBrain-0.7,这是一种具身基础模型,旨在增强各种机器人具身能力的泛化能力。该模型采用了新颖的三系统架构,在超过 37,000 小时的数据上进行了广泛的异构预训练,并采用了一阶段的对齐训练过程。与 GigaBrain-0 和 π0.5 等先前模型相比,GigaBrain-0.7 在零样本能力、指令遵循和任务成功率方面表现出显著的改进,在家庭和工业环境中都显示出强大的适应性。
-
机器人具身在AI发展中的关键作用被低估 · 追踪1个来源
在追求更智能的AI模型过程中,机器人具身(即机器人的物理硬件)的重要性正被低估。虽然AI发展通常侧重于模型能力和数据可用性,但机器人的物理限制,如延迟和精度,正在阻碍实际应用。凌宇智能的TA2机器人因其高性能的具身能力在比赛中获胜,引起了模型开发团队的极大兴趣,这凸显了对强大硬件基础设施的需求。
-
李飞飞的World Labs推出R2S2R用于机器人训练
李飞飞的World Labs推出了一款名为Real-to-sim-to-real (R2S2R) 的新型机器人训练和评估引擎。该引擎通过首先将真实世界的机器人交互重建到虚拟世界(Real-to-Sim),然后在这些模拟环境中训练和评估机器人策略,再将其部署回物理机器人(Sim-to-Real),从而弥合了模拟环境与真实世界机器人部署之间的差距。这个闭环系统旨在克服当前机器人开发中普遍存在的扩展数据采集和评估的局限性,从而实现更高效、更…
-
人形机器人通过新的VLA模型获得大语言模型驱动的“双手”
视觉-语言-动作(VLA)模型的最新进展旨在弥合大语言模型推理能力与机器人实时控制需求之间的差距。英伟达的GR00T N1.7、Google DeepMind的Gemini Robotics 1.5和Physical Intelligence的π0.5代表了应对这一挑战的不同架构方法。尽管它们都被营销为通用操作系统,但在整合感知、推理和动作方面存在差异:GR00T使用独立的网络,Gemini采用时间交错,而π0.5则试图在单个Tran…
-
具身智能公司竞相在世界人工智能大会上开发机器人触觉感知
在世界人工智能大会(WAIC)上,具身智能领域的公司越来越关注机器人的触觉感知。这种转变是由纯粹视觉感知在复杂操作任务中的局限性驱动的,在这些任务中,细微的接触信息至关重要。研究,例如涉及顶尖AI研究人员的“T-Rex”论文,表明集成触觉数据需要专门的模型和处理路径,而不仅仅是将其添加到现有的视觉系统中。
-
OpenBMB发布用于设备端机器人的MiniCPM-Robot模型
OpenBMB发布了两个新模型MiniCPM-RobotTrack和MiniCPM-RobotManip,专为机器人设备端AI设计。MiniCPM-RobotTrack专注于语言条件下的目标跟踪,利用融合的视觉特征预测未来航点,并实现高效的设备端推理。MiniCPM-RobotManip是一个更大、更通用的视觉-语言-动作模型,用于具身操作,性能优于其他模型,并具有流式上下文功能,可用于长视域决策并减少计算量。
-
新模型和框架推动具身AI能力发展
研究人员正在开发先进的模型和框架,以实现更具能力的具身人工智能。一种方法是Athena-Brain-8B,一个为设备端机器人大脑设计的8B LLM,展现出强大的通用智能和具身交互能力,并能给出简洁的响应。另一篇论文探讨了Edmund Berkeley和David L. Heiserman的历史工作,将其视为一个未被充分探索的具身智能架构,将逻辑与硬件和时间扩展行为联系起来。此外,一个1.5B的开源VLA模型MiniCPM-Robot,…
-
RoboDojo基准揭示AI机器人与人类表现的巨大差距
一项名为RoboDojo的新基准已发布,用于评估具身智能,包含42个模拟任务和18个真实世界机器人任务。该基准突显了当前AI模型与人类表现之间存在的巨大差距,在模拟环境中,最佳模型成功率仅为8.80%,在真实机器人上为12.8%,而人类的成功率分别为76.03%和100%。RoboDojo旨在为具身智能提供标准化和全面的评估,涵盖泛化能力、记忆、精度、长时序执行和开放式语义理解。
-
蚂蚁集团发布机器人开源模型LingBot-VLA 2.0 · 追踪2个来源
蚂蚁集团AI部门蚂蚁灵玎发布了LingBot-VLA 2.0,这是一个为复杂机器人任务设计的开源视觉-语言-动作(VLA)模型。新版本显著扩展了其训练数据至60,000小时,其中包含50,000小时的机器人轨迹数据和10,000小时的第一人称人类操作视频。LingBot-VLA 2.0支持来自17家制造商的20多种机器人配置,将其动作空间扩展到包括头部、腰部、末端执行器和移动基座,在物体操作和厨房清洁等任务中表现出改进的性能。
-
HIL-ResRL:AI机器人适配器1小时微调,成功率提升至95%
研究人员开发了HIL-ResRL,一种用于视觉-语言-动作(VLA)模型的新型适配器,能够对真实世界机器人任务进行快速、安全的微调。该系统使用轻量级的残差策略,并结合了人工干预(human-in-the-loop)来纠正错误,并将预训练的VLA模型适配到特定的工业环境中。在UR5e机器人手臂的测试中,HIL-ResRL在经过仅一小时的实时训练后,在抓取放置和插拔等任务上取得了超过95%的成功率,显著优于现有的强化学习基线,并通过最大限…
-
EBench 基准测试为机器人操作策略提供详细诊断
一项名为 EBench 的新基准测试已被引入,用于评估机器人领域中通用移动操作策略。与依赖单一成功率的先前基准测试不同,EBench 在 26 项任务以及多个能力和泛化维度上提供了详细的诊断概况。使用 EBench 进行的早期评估揭示了 π0.5、XVLA 和 InternVLA-A1 等最先进模型在性能上的显著差异,突出了先前被汇总分数掩盖的特定优势和劣势。这种详细分析旨在指导未来更强大、更具泛化性的机器人操作策略的开发。
-
Qwen-RobotManip 模型通过统一对齐技术推进机器人操作
研究人员开发了 Qwen-RobotManip,一个专为机器人操作设计的通用基础模型,该模型利用了统一的对齐框架。这种方法使模型能够有效地在包括人类视频和合成机器人轨迹在内的大规模、多样化数据集上进行训练,克服了以往异构操作数据的挑战。该模型展示了涌现的泛化能力,例如零样本指令遵循和跨具身迁移,在各种分布外基准测试中表现优于现有的最先进模型,并在真实机器人平台上展现出潜力。
-
VISTA框架通过验证数据改进机器人训练
研究人员开发了VISTA,一个旨在利用真实机器人数据改进视觉-语言-动作(VLA)模型训练的框架。该框架解决了相机视角失真和人类收集的轨迹在物理上不可行等挑战。VISTA包含一个新的数据集(UMI-VQA),用于处理失真的视觉输入,以及一个验证流程,用于过滤不安全或不可能的机器人动作,从而提高策略性能。
-
OpenGalaxea发布G0.5具身模型,赋能机器人“边思考边行动”
开源AI实验室OpenGalaxea发布了G0.5,这是一款新一代具身基础模型,旨在赋能机器人“边思考边行动”。该模型将推理和行动整合到单一架构中,使机器人能够执行具有零样本泛化能力的任务。G0.5采用统一的动作解码器和原生的动作思维链机制,使其能够分解长程任务并根据自然语言提示调整其行动。该模型还集成了时空注意力模块以增强上下文感知能力,并在各种基准测试中展示了最先进的性能。
-
基于17,800小时真实机器人数据训练的开源具身世界模型
研究人员推出了τ0-World Model (τ0-WM),这是一个开源的具身世界模型,在海量的30,000小时数据上进行了训练,其中大部分(17,800小时)来自真实机器人远程操作。该模型超越了预测未来状态的能力,通过引入测试时计算(Test-Time Computation),使机器人在执行前能够评估和选择最优动作,甚至纠正潜在错误。与之前的模型相比,τ0-WM在复杂操作任务上表现出更优异的性能,挑战了仅将真实世界数据用于微调的传统方法。