EgoExo4D
PulseAugur coverage of EgoExo4D — every cluster mentioning EgoExo4D across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新的P-JEPA方法增强了AI对程序化视频的理解能力
研究人员开发了一种名为P-JEPA(程序化联合嵌入预测架构)的新方法,以改进程序化视频表示的学习。该方法通过将问题简化为密集、帧对齐的动作空间,解决了现有模型在处理具有复杂、多步骤任务的长时间视频方面的局限性。P-JEPA可以处理长达30分钟以上的视频,能够有效理解程序化步骤,并在细粒度动作分类任务上取得最先进的成果,同时使用的参数比基于大型语言模型的方法少得多,并且能够实时运行。
-
SkillMoV框架增强多视角视频技能估计
研究人员开发了SkillMoV,一个用于从多视角视频估计人类熟练度的新颖框架。该参数高效系统利用了混合视角投影仪(MoVP),该投影仪将混合专家范式应用于不同的摄像机视角。SkillMoV结合了软路由、跨视角注意力、原型锚定和门控投影来生成技能嵌入。在EgoExo4D数据集上进行评估时,SkillMoV在Exos设置中实现了50.17%的总体准确率,以单一、联合训练的模型,比现有方法提高了3.57个百分点。
-
EgoPriMo框架从人类演示生成人形机器人运动
研究人员开发了EgoPriMo,这是一个用于通过以自我为中心的人类演示生成人形机器人全身运动的新框架。该系统接收以自我为中心的视觉观察和文本提示,以重建、生成和预测基于SMPL的运动。EgoPriMo利用了Triple-stream DiT模型,该模型处理身体动力学、视觉上下文和文本,使其能够从多样化的人类动作中学习可泛化和交互式的运动先验。
-
新AI模型增强机器人视觉运动控制和记忆能力
研究人员开发了新的机器人视觉运动控制模型,专注于高效和预测性协调。CT-VAM是一个受小脑-丘脑启发的模型,采用紧凑的架构进行快速、任务条件化的动作预测,支持云边协同范式。Chameleon通过整合控制索引的前瞻性记忆来解决观察-动作延迟问题,显著提高了在具有挑战性基准上的性能。此外,一个基于扩散的框架通过整合多模态信号来预测人类运动,从而学习预测性的视觉运动协调。
-
发布了新的主动式AI助手基准和架构
研究人员推出了一种名为Pro extsuperscript{2}Bench的新型数据集和基准套件EgoProactive,旨在评估主动式程序辅助系统。这些系统旨在为任务提供实时、分步指导,包括自主决定何时打断以及如何指导用户,尤其是在用户偏离预期计划时。所提出的解耦规划器-交互架构在Llama 4上进行训练后,在客观干预质量和偏离计划恢复方面,相比专有模型和开源模型均取得了显著改进。
-
新基准解决具身AI的能效动作分割问题
研究人员推出了Ego-METAS,一个专为以自我为中心、多模态、能效时间动作分割设计的新基准。该基准利用来自三个数据集的100多小时以自我为中心的视频数据,集成了RGB、音频、注视、IMU和黑白摄像头等五种传感器模态。该任务要求模型在严格的能源预算内动态选择激活哪些传感器,解决了具身智能体能源感知这一探索不足的领域。初步评估表明,最优传感器路由高度依赖于具体场景,并且当前的策略学习方法在连续、未修剪的环境中存在困难,尽管即使是简单的动…
-
TROPHIES框架统一了人物、场景和摄像机的四维重建
研究人员推出TROPHIES,一个用于从多视角视频中统一重建动态人物、静态场景和摄像机姿态的四维重建新框架。与以往常常将这些元素解耦的方法不同,TROPHIES在单一全局坐标系内联合估计它们。该框架利用一个用于时空推理的人体分支和一个具有感知人类注意力的场景分支,并通过一个强制视图间一致性和物理合理性的全局对齐模块进行耦合。