WAM
PulseAugur coverage of WAM — every cluster mentioning WAM across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
FastOPD框架支持大型VLA模型的高效部署
研究人员开发了FastOPD,一个旨在通过降低计算成本来提高大型视觉-语言-动作(VLA)模型在现实场景中可部署性的新框架。该方法使用在线策略蒸馏,从大型教师模型训练一个更小、更高效的学生模型,在更少的推理步骤中保留显著的性能。实验表明,FastOPD可以显著降低推理延迟,同时在各种VLA模型甚至World Action Model上保持高成功率,证明了其在机器人和AI部署中的实用性。
-
新基准揭示局部图像水印的脆弱性
一项新的基准测试评估了局部不可见图像水印方法在55种不同图像变换下的鲁棒性。研究发现,虽然MaskWM提供了最强的载荷恢复和定位能力,但其图像质量也是最低的。几何错位以及修复和外绘等生成式编辑显著损害了水印恢复效果,这表明鲁棒性在很大程度上取决于变换的性质。
-
盛趣科技Motus2赋能机器人实现闭环学习自我进化 · 追踪2个来源
盛趣科技发布了其具身智能世界模型Motus2,旨在通过行动、预测和评估的闭环系统使机器人能够自我进化。该新模型整合了视觉、语言、动作和触觉等多种模态,并通过利用自身预测和评估来优化策略,探索递归自我改进(RSI)。Motus2还融入了记忆功能,并利用大规模人类第一人称(Ego)数据来训练高自由度机械手执行复杂操作任务。
-
神秘具身AI“MVP”展现类人认知与自我进化能力
一个神秘团队发布了数个令人印象深刻的演示视频,展示了一个代号为“MVP”(Make Veritable People)的新型具身AI模型,旨在赋予机器人类似人类的认知能力和持续的自我进化能力。演示视频重点展示了该机器人先进的物理理解能力,例如能够无缝处理物体并对干扰做出反应而不洒水,以及它学习和适应人类行为及环境背景的能力。该团队声称该模型能够以零样本(zero-shot)方式执行任务,且成功率很高,这表明在实现真正智能和适应性强的具…
-
新的APT方法提高了再生图像的篡改检测能力
研究人员开发了一种名为APT(Anchor-aligned Perturbations)的新方法,用于检测图像篡改,特别是在经过完全再生而非简单拼接的图像中。该技术在图像的潜在空间中嵌入半脆弱信号,即使在修复过程破坏了传统信号后,也能检测像素级别的操纵。实验表明,APT在COCO数据集上的表现显著优于现有方法,在完全再生图像的篡改定位方面达到了0.92的IoU,而之前最好的结果是0.84。
-
Future Robotics 6个月内获超10亿人民币融资,机器人已部署超500个家庭
专注于家用通用机器人的公司Future Robotics在六个月内完成了三轮融资,总金额超过10亿元人民币。最新一轮融资吸引了字节跳动的投资,以及其他知名机构和产业资本。该公司已成功将其机器人部署到500多个家庭,展示了烹饪和洗衣等复杂任务的能力,并曾在WAIC和WRC等主要科技活动上展出。
-
EgoGenesis模拟器生成自我中心视频以促进具身AI训练
研究人员开发了EgoGenesis,一个旨在为具身AI训练生成自我中心世界动作视频的模拟器。该系统利用预训练的视频生成模型,并增强了在线锚定投影记忆(OAPM)以维持场景锚点,以及动作-3D旋转位置嵌入(A3D-RoPE)以整合动作几何。这种方法提高了生成自我中心序列的视觉保真度和动作对齐度。用EgoGenesis生成的视频增强真实世界机器人训练数据,在下游任务泛化方面取得了显著改进,尤其是在双臂操作方面。
-
ICML 2026 的世界模型:LAWM 和 WAM 融合以实现具身人工智能
ICML 2026 的研究表明,世界模型正经历范式转变,从简单的视频预测转向现实世界的控制。虽然潜在动作世界模型 (LAWM) 从视频中提供基础的物理直觉,但动作世界模型 (WAM) 在显式控制任务中卷土重来。新兴的共识倾向于混合方法,使用 LAWM 进行广泛的预训练,并使用 WAM 结合真实机器人数据进行微调,这与大型语言模型的成功相呼应。
-
新框架通过人类视频引导机器人模型
研究人员开发了WAM-TTT,一个旨在利用人类游玩视频来引导机器人基础模型(RFMs)的新框架。该方法无需额外的机器人演示或特定任务的微调即可进行适应。WAM-TTT利用自监督视频预测,将人类视频整合到冻结的世界动作模型(WAM)中的自适应记忆中,从而实现对各种操作任务的高效且可重用的引导。
-
英伟达Jim Fan:VLA和远程操控已死,世界动作模型崛起
英伟达的Jim Fan宣布视觉-语言-动作(VLA)模型和机器人远程操控的终结,并倡导世界动作模型(WAM)作为新范式。Fan提出,受大型语言模型(LLM)的启发,WAM将利用下一状态预测和动作微调来进行机器人控制。他强调,将以第一人称人类视频数据作为主要训练来源,摆脱远程操作数据收集的局限性。