研究人员提出了一种新的方法来检测自我中心视频中何时有人在直接对摄像机佩戴者说话。该方法将问题从二元分类重新构建为在线、帧级别的预测,并考虑了各种非“跟我说话”(TTM)的状态,例如对他人说话或自言自语。创建了一个新的数据集,即在线TTM数据集,其中包含约90万个带注释的帧来支持这种表述。一个整合了音频、视觉和语音语义线索的多模态模型在TTM检测中达到了75.5%的帧级别F1分数。 AI
影响 改进了对自我中心视频中社交互动的理解,可能催生更复杂的AI助手。
排序理由 该集群包含一篇详细介绍计算机视觉任务新方法和数据集的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Ego4D: Around the World in 3,000 Hours of Egocentric Video
- Egocentric Videos
- Hugging Face
- Online TTM Dataset
- Talk-to-Me Detection
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →