PulseAugur
实时 12:28:12
实体 EgoExo4D

EgoExo4D

PulseAugur coverage of EgoExo4D — every cluster mentioning EgoExo4D across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
4
90 天内 11
发布 · 30天
0
90 天内 0
论文 · 30天
4
90 天内 11
层级分布 · 90 天
主题
情绪 · 30 天

4 天有情绪数据

最近 · 第 1/1 页 · 共 11 条
  1. TOOL · CL_231706 ·

    新的RESELF框架统一了第一人称视角视频的3D场景和运动估计

    研究人员开发了RESELF,一个用于从第一人称视角视频进行3D感知的新框架,该框架可同时重建周围场景并估计佩戴者的全身运动。与以往分别处理这些任务的方法不同,RESELF通过调整一个几何基础模型以适应第一人称视角数据来统一它们。该方法使用逐帧一致性目标来条件化用于运动生成的扩散模型,并通过一个反馈阶段来优化相机姿态,同时保留场景几何。与现有的最先进方法相比,该框架在深度估计、相机跟踪和全身运动估计方面表现出卓越的性能。

  2. TOOL · CL_228893 ·

    PRISM 方法学习视角不变的视频表示

    研究人员开发了 PRISM,一种用于学习视角不变的视频表示的新方法。PRISM 将视频分解为视角不变和视角可变的潜在特征,并使用语言监督来确保清晰分离。该方法在 EgoExo4D 和 EgoExoLearn 等多个基准测试中取得了最先进的成果,甚至在零样本场景中超越了特定领域的模型。

  3. TOOL · CL_216151 ·

    新框架从外中心源生成内中心视频

    研究人员开发了 Grounded-Exo2Ego,一个用于从外中心视频生成内中心视频的新颖框架,这对于增强现实、虚拟现实和具身人工智能应用至关重要。该框架采用双分支视频扩散模型,结合了几何锚定和语义地面化分支,以提高视频质量,尤其是在视角变化极端的挑战性区域。为解决相机-重建不对齐问题,引入了一种新的相机重新定位算法,并创建了一个合成数据引擎来生成逼真的训练数据。在 EgoExo4D 数据集上的评估表明,Grounded-Exo2Eg…

  4. RESEARCH · CL_210267 ·

    新方法从以自我为中心的摄像头估计心率变异性

    研究人员开发了EgoHRV,这是一种新颖的方法,使以自我为中心的视觉系统仅使用注视摄像头即可估计心率变异性(HRV)和心率(HR)。该技术克服了以往由以自我为中心的视频中的运动和噪声引起的限制,这些限制掩盖了HRV分析所需的精细时序。通过采用3D骨干网络和低-高频分解模块,EgoHRV提取血容量脉冲信号,并对来自接触式和摄像头派生数据的频域表示进行对齐。该系统在HR和HRV估计方面展示了最先进的准确性,并将其集成到EgoExo4D熟练…

  5. TOOL · CL_105137 ·

    新的P-JEPA方法增强了AI对程序化视频的理解能力

    研究人员开发了一种名为P-JEPA(程序化联合嵌入预测架构)的新方法,以改进程序化视频表示的学习。该方法通过将问题简化为密集、帧对齐的动作空间,解决了现有模型在处理具有复杂、多步骤任务的长时间视频方面的局限性。P-JEPA可以处理长达30分钟以上的视频,能够有效理解程序化步骤,并在细粒度动作分类任务上取得最先进的成果,同时使用的参数比基于大型语言模型的方法少得多,并且能够实时运行。

  6. RESEARCH · CL_96068 ·

    SkillMoV框架增强多视角视频技能估计

    研究人员开发了SkillMoV,一个用于从多视角视频估计人类熟练度的新颖框架。该参数高效系统利用了混合视角投影仪(MoVP),该投影仪将混合专家范式应用于不同的摄像机视角。SkillMoV结合了软路由、跨视角注意力、原型锚定和门控投影来生成技能嵌入。在EgoExo4D数据集上进行评估时,SkillMoV在Exos设置中实现了50.17%的总体准确率,以单一、联合训练的模型,比现有方法提高了3.57个百分点。

  7. TOOL · CL_80247 ·

    EgoPriMo框架从人类演示生成人形机器人运动

    研究人员开发了EgoPriMo,这是一个用于通过以自我为中心的人类演示生成人形机器人全身运动的新框架。该系统接收以自我为中心的视觉观察和文本提示,以重建、生成和预测基于SMPL的运动。EgoPriMo利用了Triple-stream DiT模型,该模型处理身体动力学、视觉上下文和文本,使其能够从多样化的人类动作中学习可泛化和交互式的运动先验。

  8. RESEARCH · CL_72801 ·

    新AI模型增强机器人视觉运动控制和记忆能力

    研究人员开发了新的机器人视觉运动控制模型,专注于高效和预测性协调。CT-VAM是一个受小脑-丘脑启发的模型,采用紧凑的架构进行快速、任务条件化的动作预测,支持云边协同范式。Chameleon通过整合控制索引的前瞻性记忆来解决观察-动作延迟问题,显著提高了在具有挑战性基准上的性能。此外,一个基于扩散的框架通过整合多模态信号来预测人类运动,从而学习预测性的视觉运动协调。

  9. RESEARCH · CL_70329 ·

    发布了新的主动式AI助手基准和架构

    研究人员推出了一种名为Pro extsuperscript{2}Bench的新型数据集和基准套件EgoProactive,旨在评估主动式程序辅助系统。这些系统旨在为任务提供实时、分步指导,包括自主决定何时打断以及如何指导用户,尤其是在用户偏离预期计划时。所提出的解耦规划器-交互架构在Llama 4上进行训练后,在客观干预质量和偏离计划恢复方面,相比专有模型和开源模型均取得了显著改进。

  10. TOOL · CL_66247 ·

    新基准解决具身AI的能效动作分割问题

    研究人员推出了Ego-METAS,一个专为以自我为中心、多模态、能效时间动作分割设计的新基准。该基准利用来自三个数据集的100多小时以自我为中心的视频数据,集成了RGB、音频、注视、IMU和黑白摄像头等五种传感器模态。该任务要求模型在严格的能源预算内动态选择激活哪些传感器,解决了具身智能体能源感知这一探索不足的领域。初步评估表明,最优传感器路由高度依赖于具体场景,并且当前的策略学习方法在连续、未修剪的环境中存在困难,尽管即使是简单的动…

  11. RESEARCH · CL_65193 ·

    TROPHIES框架统一了人物、场景和摄像机的四维重建

    研究人员推出TROPHIES,一个用于从多视角视频中统一重建动态人物、静态场景和摄像机姿态的四维重建新框架。与以往常常将这些元素解耦的方法不同,TROPHIES在单一全局坐标系内联合估计它们。该框架利用一个用于时空推理的人体分支和一个具有感知人类注意力的场景分支,并通过一个强制视图间一致性和物理合理性的全局对齐模块进行耦合。