研究人员开发了一种多模态方法,通过在音频中加入视觉线索来改进对话中的轮次转换预测。该研究扩展了语音活动预测 (VAP) 模型,整合了来自 Meta Seamless Interaction 数据集的注视方向、头部运动和面部动作单元等特征。结果表明,与仅使用音频的方法相比,视觉信息显著提高了预测准确性,其中面部动作单元尤其具有信息量。当结合所有视觉特征时,取得了最佳性能,这表明不同模态的贡献是互补的。 AI
影响 通过整合视觉线索,增强了 AI 理解和参与自然人类对话的能力。
排序理由 详细介绍多模态 AI 在对话分析中新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Hugging Face
- Julio Cesar Cavalcanti
- Meta Seamless Interaction dataset
- Voice Activity Projection
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →