Ego4D: Around the World in 3,000 Hours of Egocentric Video
PulseAugur coverage of Ego4D: Around the World in 3,000 Hours of Egocentric Video — every cluster mentioning Ego4D: Around the World in 3,000 Hours of Egocentric Video across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
音频优先分类可削减自我中心视频字幕的VLM调用
研究人员开发了一种新颖的音频优先方法,用于高效字幕化长视频。该方法优先考虑音频线索,以决定哪些视频片段对视觉语言模型(VLM)的分析最相关,从而降低计算成本。通过训练系统每行动触发一次,而不是每帧触发一次,与现有的基于视觉特征或均匀采样的方法相比,该技术显著提高了行动覆盖率并减少了VLM调用,即使使用冻结的音频特征也是如此。
-
机器人学习人类动作:连接视频数据与机器人控制的四种方法 · 跟踪 1 个来源
清华大学、香港科技大学和微软亚洲研究院的联合论文提出了一种统一的框架,使机器人能够从人类视频中学习人类动作。该研究确定了四种主要方法:潜在动作、显式二维轨迹、显式三维轨迹和世界模型,所有这些都旨在构建人类动作与机器人控制信号之间的“表示桥梁”。虽然世界模型被视为泛化的有希望的方向,但目前的实际演示通常依赖于结合了强化学习的视觉-语言-动作(VLA)模型,这凸显了在为具身人工智能寻找最佳“配方”方面仍然存在挑战。
-
新的SmartRes框架提高了自我中心视觉基础的效率
研究人员开发了SmartRes,一个旨在通过动态路由高分辨率图像块来提高自我中心视觉基础效率的新颖框架。该方法解决了多模态大型语言模型处理高分辨率输入带来的高计算成本问题。SmartRes编码低分辨率全局上下文,并使用轻量级路由器激活特定的以对象为中心的区域,在保持性能的同时显著减少视觉令牌。该框架还包含一个边距正则化路由目标,以提高前景召回率,特别是在前景-背景元素不平衡的情况下。
-
SmartRes 框架提高了以自我为中心的视觉地面定位效率
研究人员开发了 SmartRes,一个旨在提高以自我为中心的视觉地面定位任务效率的新型框架。该方法通过动态地将高分辨率块路由到以对象为中心的区域来优化像素空间的处理,从而减少了对大量视觉标记处理的需求。与现有的标记减少技术相比,SmartRes 在保持高性能的同时,实现了高达 67% 的视觉标记显著减少,并提供了更快的推理速度。该框架的有效性在 Ego4D 和 EgoIntention 等数据集上得到了证明,尤其是在小型对象地面定位应用方面。
-
EgoPlay系统实现了面向第一人称视频流的事件触发视频编辑
研究人员开发了EgoPlay,一个用于第一人称视频流中事件触发视频编辑的新颖系统。该系统通过V2V扩散Transformer进行微调,主要使用Ego4D数据,能够识别视频中的特定事件,并仅对事件后的片段应用编辑。EgoPlay将事件识别、时间控制和像素级编辑整合到一个端到端的模型中,在编辑质量、视觉质量和背景一致性方面,在Ego4D基准测试中优于EgoEdit等现有基线。
-
未来上下文可改善注视估计,但仅限于一定程度
研究人员开发了一个框架来研究未来视频帧对自我中心注视估计模型的影响。他们的研究结果表明,虽然未来上下文可以改善因果注视预测,但收益会达到平台期,并且不会随着更长的前瞻时间而增加。该研究建议,对于实时应用程序,最佳未来上下文为 1.7 至 3.3 秒。
-
新数据集和模型推动场景图推理以理解人类活动
研究人员推出了SG-Ego,一个扩展Ego4D的新数据集,包含时空场景图,以更好地理解第一人称视频中的人类活动。他们还开发了GLEN,一个基于图的模型,用于处理这些场景图序列以进行动作对齐和时间演化建模。提出的活动驱动图编辑预测(A-GEF)任务将场景动态构建为以动作为条件的结构化变换,从而能够对场景变化进行显式推理。
-
新基准LongEgoRefer挑战AI进行长篇主观视角视频理解
研究人员推出了LongEgoRefer,这是一个旨在评估长篇主观视角视频中视频指代表达理解能力的新基准。该基准源自Ego4D数据集,包含近1500个指代表达,视频平均长度为45分钟,面临着物体稀疏出现和复杂人机交互等挑战。当前最先进的模型甚至无需训练的基线模型在LongEgoRefer上都表现不佳,凸显了对更先进的视频理解模型的需求,这些模型能够对扩展的、动态的叙事进行时空定位。
-
FlexLAM 引入可变长度潜在动作以改进基于视频的决策制定
研究人员推出了一种新颖的潜在动作学习方法 FlexLAM,该方法解决了现有模型中的瓶颈权衡问题。与使用固定容量瓶颈的先前方法不同,FlexLAM 采用通过嵌套 dropout 训练的可变长度潜在动作。这使得模型能够首先捕获紧凑的转换结构,并在需要时添加细节,而无需新的架构或损失函数。FlexLAM 在各种 token 预算和压力测试中均表现出改进的性能,表明它是潜在动作模型和视频预训练动作接口的通用升级。
-
发布了新的主动式AI助手基准和架构
研究人员推出了一种名为Pro extsuperscript{2}Bench的新型数据集和基准套件EgoProactive,旨在评估主动式程序辅助系统。这些系统旨在为任务提供实时、分步指导,包括自主决定何时打断以及如何指导用户,尤其是在用户偏离预期计划时。所提出的解耦规划器-交互架构在Llama 4上进行训练后,在客观干预质量和偏离计划恢复方面,相比专有模型和开源模型均取得了显著改进。
-
新方法融合动手轨迹以实现自我中心的视频查询定位
研究人员开发了一种新的方法,通过整合动手轨迹数据,在自我中心的视频中定位自然语言查询。该方法使用交叉注意力和自适应门控,将手的运动学特征与预训练的视频-文本特征融合。该方法显示出显著的改进,特别是对于涉及手-物体交互以及数量/状态变化的查询,证明了手部运动在时间定位方面超越视觉外观的价值。
-
FROST-STA 系统预测自我中心视频中的目标交互
研究人员开发了 FROST-STA,一个用于自我中心视频短期预测的系统,旨在预测目标交互。该模型使用来自 ViT-G 主干的冻结密集特征,提取视频和图像 token,然后进行融合和解码以预测目标框、标签和接触时间。FROST-STA 在 Ego4D 短期目标交互预测挑战赛中获得第二名,证明了预训练特征在交互预测中的有效性。
-
新模型推进AR眼镜传感器行为识别
研究人员开发了一种新方法,利用头戴式惯性测量单元(IMU)的数据来识别复杂的人类行为,IMU常见于AR智能眼镜中。他们创建了一个大型数据集和一个名为HiT-HAR的分层模型,该模型显著改进了现有的基于IMU的识别系统。该研究还分析了IMU传感器在区分不同行为方面的局限性,强调了时间上下文和场景特定结构在模型架构中的重要性。
-
VISTA 系统凭借物体交互预测能力赢得 Ego4D 挑战赛
研究人员开发了 VISTA,一个用于预测第一人称视角视频中人类与物体交互的新型系统。VISTA 集成了空间物体检测和来自冻结的 V-JEPA 2.1 模型的时序上下文来预测未来的交互。该方法在 EgoVis 2026 年 Ego4D 短期物体交互预测挑战赛中获得第一名。