EPIC-KITCHENS-100
PulseAugur coverage of EPIC-KITCHENS-100 — every cluster mentioning EPIC-KITCHENS-100 across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
音频优先分类可削减自我中心视频字幕的VLM调用
研究人员开发了一种新颖的音频优先方法,用于高效字幕化长视频。该方法优先考虑音频线索,以决定哪些视频片段对视觉语言模型(VLM)的分析最相关,从而降低计算成本。通过训练系统每行动触发一次,而不是每帧触发一次,与现有的基于视觉特征或均匀采样的方法相比,该技术显著提高了行动覆盖率并减少了VLM调用,即使使用冻结的音频特征也是如此。
-
新框架Pegasus将人类视频转化为机器人学习数据
研究人员开发了Pegasus,一个旨在弥合机器人领域具身差距的新框架。该系统通过构建包含任务、可供性(affordance)和约束图谱的知识图谱,将人类操作视频转化为机器人可学习的数据。Pegasus利用分层可供性潜在空间进行泛化,并使用物理验证器来确保运动学可行性和关节限制的遵守。在GTEA Gaze+和EPIC-KITCHENS-100等基准测试中进行评估,Pegasus展示了可靠的跨具身转换能力,将机器人数据生成重新定义为一个可…
-
新的基准和模型推动了人工智能中以自我为中心的视频理解能力
研究人员正在开发新的方法和基准来提高多模态大语言模型(MLLMs)的时间和空间推理能力,特别是针对以自我为中心的视频理解。论文介绍了时间全局策略优化(TGPO)等技术来增强时间感知能力,以及Whareformer等模型用于跟踪长时以自我为中心的视频中的对象。新的基准,如EgoPolice和EgoExoMem,正在被创建,以在具有挑战性的数据集上评估这些模型,包括警方佩戴的摄像机录像和同步的以自我为中心/以外的视频对,突显了即使是像Ge…
-
新的具身人工智能系统利用自拍视频实现记忆和主动辅助
研究人员推出了新的具身人工智能系统和数据集,专注于从自拍视频中获取记忆和主动辅助。MEMORA 旨在为机器人配备具身动作记忆,通过四个记忆存储的形成、巩固和检索生命周期来改进规划和目标理解。另外,Vinci2 通过推理时间上下文来确定智能代理何时应进行干预,从而提供主动辅助,并引入了 EgoServe 基准和 EgoMemo 代理。此外,Open-AoE 为从自拍操作视频中进行具身学习提供了大规模数据集和工具链,促进了人机转移和世界建模。
-
TrAction 使用稀疏轨迹实现高效动作识别
研究人员开发了 TrAction,一种新颖的 Transformer 架构,用于使用稀疏点轨迹而非密集视频进行动作识别。该方法旨在减少依赖外观或背景线索的传统模型中存在的偏差。TrAction 在 Something-Something V2 和 EPIC-Kitchens-100 等基准测试中取得了有竞争力的准确率,并且与其他模型融合后,性能得到进一步提升。
-
TAP-JEPA模型在动作预测挑战赛中获得第二名
研究人员开发了TAP-JEPA,一种新颖的动作预测模型,在EPIC-KITCHENS-100挑战赛中获得第二名。该模型利用冻结的V-JEPA 2.1特征,使用ViT-G/384编码器和潜在预测器来估计未来的视频token。然后,这些token与观察到的上下文通过注意力探针融合,以预测动作,特别是动词、名词和动词-名词对。该提交的平均Top-5召回率为27.91%,以0.04个百分点的微弱劣势错失头名。