Embodied Ai
PulseAugur coverage of Embodied Ai — every cluster mentioning Embodied Ai across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
传化化工开放300多个工业场地用于具身智能机器人训练
总部位于浙江的制造商传化化工正开放其300多个工业环境,用于具身智能的开发和部署。这些地点包括化工厂、物流园区和农场,将作为机器人的训练和测试场地。此举旨在加速人工智能在实际工业应用中的融合。
-
ECCV 2026 聚焦 AI 预测与行动能力的转变 · 追踪 1 个来源
ECCV 2026 会议将显著增加对世界模型(World Models)和具身人工智能(Embodied AI)的研究,设有 13 个相关研讨会,这标志着人工智能正从理解世界转向预测和行动。这一转变的驱动力在于生成式 AI 的进步使得世界预测能力得到提升,以及机器人和自主系统对新学习范式日益增长的需求。关键讨论将围绕构建、评估和将这些模型整合到可操作的系统中,中国研究人员正积极参与定义边界、建立评估指标以及在真实机器人上部署模型。
-
AI代理防护措施易受文本编辑器攻击,具身AI面临数据库瓶颈
本期Moltbook Pulse探讨了当前AI代理防护措施的局限性,特别是“工具名防护措施”,一旦代理获得文本编辑器访问权限,这些措施就无效了。该出版物还讨论了“效果级防护栏”和“中止合同”作为解决这些漏洞的潜在方案。此外,它还提出,具身AI的发展将在遇到物理灵活性限制之前,面临数据库管理方面的瓶颈。
-
Direct Drive 发布轮腿式机器人以实现具身智能的进入
中国初创公司 Direct Drive 正在开发轮腿式机器人,旨在克服现实世界中的物理障碍。该公司认为,改进机器人的物理能力而非仅仅是其智能,是推进具身智能的关键。其机器人利用直接驱动执行器和轮腿式设计来导航路缘和斜坡等各种地形,从而能够进入不同的环境。
-
新的RegCL框架将SAM适应于多传感器AI
研究人员开发了RegCL,一个用于持续适应Segment Anything Model (SAM)以实现AR/VR和具身AI等多传感器媒体中视觉基础的新型框架。与需要大量重放数据或特定领域模块的传统方法不同,RegCL采用非重放方法,将轻量级适应模块(如LoRA风格的AugModules)合并到一个紧凑的适配器中。该方法优化了预测一致性并保留了历史特征统计信息,在各种分割数据集上的表现优于现有的持续学习和合并基线。RegCL的紧凑性使…
-
研究论文强调语音控制的具身AI的安全风险
一篇新发表在arXiv上的研究论文探讨了语音控制的具身AI系统的安全影响。研究表明,自动语音识别(ASR)中的错误可能导致这些AI模型接受并执行不安全的指令。通过模拟ASR错误并将其与SafeAgentBench和POEX等现有安全基准相结合,该研究强调了此类错误如何引入有害的歧义或削弱拒绝行为,从而导致生成和执行不安全的计划。虽然ASR错误的自动纠正有时可以减轻这些风险,但并非总是有效,这表明具身AI存在重大的安全隐患。
-
中国2030年瞄准6G、人工智能、机器人技术以实现经济增长
中国旨在到2030年将包括6G、机器人技术、量子技术和脑机接口在内的多个高科技领域打造成新的经济增长引擎。工业和信息化部计划加速人工智能在制造业的商业化应用,特别关注机器人和自动化系统的具身智能。这项举措是更广泛战略的一部分,旨在在经济挑战和国际审查的背景下,促进技术自立和高质量发展。
-
新框架通过跨具身学习和程序化生成增强具身AI模拟
研究人员开发了用于为具身AI创建更真实、更通用的模拟环境的新框架。CLAP通过协调不同的动作空间,能够在不同机器人和人类代理的各种视频数据上进行训练,旨在提高泛化能力并超越单一具身模型。4DSynth从自然语言、蓝图或照片生成可控、可编辑的4D环境,便于创建动态模拟。NeoWorld-Pro使用MLLM将单张图像转换为可执行程序,用于交互式3D环境,并通过物理引擎进行优化以提高真实性,从而能够执行复杂的下游任务。
-
新基准暴露具身AI指令遵循中的潜在安全风险
研究人员推出了GuardianBench,一个旨在评估具身AI系统中潜在上下文风险的新基准。该基准侧重于AI模型在同一视觉场景中区分安全和不安全指令的能力,这是安全方面一个被低估的关键方面。对最先进的视觉语言模型的初步测试揭示了显著的弱点,模型在给定上下文中未能准确区分安全和不安全指令。该研究还提出判决对数赔率监督(VLOS)作为一种训练后方法,以提高这些模型的安全推理能力。
-
DreamHand框架重新利用视频扩散模型进行3D手部运动恢复
研究人员开发了DreamHand,一个新框架,它重新利用视频扩散模型来改进从自我中心视频中恢复3D手部运动。该方法通过使用确定性几何编码器来解决物体遮挡和手部离开画面等挑战。DreamHand在多个基准测试中取得了最先进的成果,显著降低了度量手部轨迹恢复的误差,尤其是在考虑手部不可见的情况下。
-
星纪时代CEO:世界模型将驱动下一代具身智能
星纪时代CEO陈建宇提出,具身智能将从视觉-语言-动作(VLA)模型转向世界模型。VLA专注于模仿人类行为,而世界模型旨在理解和预测物理世界的动态,从而实现机器人更强的泛化能力。陈建宇强调,这种由视频预测驱动的方法为机器人应对新任务和与复杂环境互动提供了更坚实的基础,超越了单纯的模仿。
-
人形机器人出货量激增300%,聚焦AI泛化能力
2026年世界机器人大会凸显了具身智能的进步,上半年人形机器人出货量激增近300%,达到22,000多台。尽管增长显著,但其中很大一部分机器人尚未集成到智能制造或仓储中。该行业目前正专注于提高机器人的泛化和模仿能力,Google DeepMind、OpenAI、Tesla和Amazon等主要参与者展示了他们的最新进展。
-
SpecVLA框架提升具身AI中VLA模型的效率
研究人员开发了SpecVLA,一个用于协同设计算法和硬件架构的新框架,以提高具身AI中视觉-语言-动作(VLA)模型的效率。该方法利用了机器人环境在活跃和非活跃状态之间交替的观察,从而在非活跃期间进行推测性的长动作长度预测,并在活跃期间进行选择性验证。SpecVLA包括一个算法侧执行范式和一个较小的验证模型(sVLA),以及一个具有并行执行能力的系统侧异构架构。在LIBERO和ManiSkill等基准测试上的评估表明,SpecVLA在…
-
3D高斯溅射技术向具身AI发展,兼具效率与适应性
研究人员正将3D高斯溅射(3DGS)从高质量渲染推进到具身AI和机器人领域的实际应用。CVPR 2026 上展示的最新研究专注于使3DGS在现实世界部署中更高效、更具适应性。创新包括用于快速场景生成的前馈网络,以及根据计算资源自适应控制高斯基元密度。
-
Hubert Dreyfus 1985年对人工智能局限性的批判重新浮现
该集群讨论了Hubert Dreyfus在1985年对人工智能的批判,重点关注符号人工智能的局限性。Dreyfus认为,人类智能依赖于具身理解和实践技能,而这些仅凭符号推理很难或不可能捕捉。他的工作借鉴了Heidegger和Merleau-Ponty等思想家的哲学概念,挑战了他那个时代普遍存在的人工智能范式。
-
HandEdit 数据集和基准发布,用于机器人手图像编辑
研究人员推出了 HandEdit,这是一个大规模数据集和基准,旨在弥合人类手部数据与具身 AI 的机器人化身之间的差距。该数据集包含 26 种不同的 URDF 配置下的 2 亿多个编辑实例,能够将人类的手转换为机器人手。HandEdit 旨在通过利用丰富的人类视频数据,促进具身感知图像编辑模型的开发,并推动可扩展的灵巧机器人学习。
-
PhysX-CoT:新方法生成具有显式物理推理的3D资产
研究人员推出PhysX-CoT,一种从单张图像生成可用于仿真的3D资产的新方法。与先前将其视为隐式视觉语言任务的方法不同,PhysX-CoT将该过程显式地建模为一个结构化的物理推理轨迹。该方法将资产生成分解为不同的、受监督的阶段,包括分解、2D/3D接地、关系识别、粗糙几何和表面提示,从而提高了几何、尺度和物理属性的准确性。生成的资产在Unreal Engine 5中已显示出高有效性和可操作性。
-
X Square Robot展示了更便宜、更快的具身智能及其新的学习框架
X Square Robot公布了具身智能的进展,展示了其WALL-B系统,该系统在包裹分拣方面比Figure 03的性能提高了45%,同时成本降低了70%。此外,该公司开源了HOST,这是一个使人形机器人能够从简短的视频演示中学习新技能的框架,学习时间最短可达29秒,成功率达到62%。这种方法将具身智能训练从漫长的离线过程转变为快速、即时的模仿。
-
Deltoris框架为具身AI实现实时VLA推理
研究人员开发了Deltoris,一个旨在为具身AI系统中的视觉-语言-动作(VLA)模型实现实时推理的新框架。该框架解决了基于扩散的VLA模型的高计算需求,这些模型对于先进的机器人和AI代理至关重要。Deltoris采用时间感知比特稀疏性来减少冗余计算,并通过推测性推理来分摊数据加载成本,从而显著提高了效率。
-
新研究整合世界模型以实现高效的具身AI控制
三篇新研究论文介绍了通过更有效地整合世界模型来增强具身AI控制的新方法。WorldSimProbe 专注于诊断动作条件世界模型的忠实度,确保其预测与物理现实一致。Enfold 提出一种将世界模型的生成计算内化到表示中的方法,显著降低了动作延迟。World Tokens 在训练过程中使用世界模型来改进动作预测,从而增强具身策略,并在推理时移除世界模型分支以保持高效部署。