研究人员开发了一种新颖的跨模态特征嵌入方法,以改进面部图像和语音片段之间的关联。该技术解决了音视频特征的异质性问题,而这常常导致先前方法的不准确。通过将语音和面部特征嵌入凸包内并利用跨模态注意力,所提出的方法显著减少了假阳性和假阴性。在VoxCeleb数据集上的实验表明,与现有的最先进方法相比,在跨模态验证、匹配和检索任务方面有了显著的改进。 AI
影响 这项研究可能为需要匹配面部和语音的任务(如说话人验证和识别)带来更准确、更鲁棒的系统。
排序理由 该集群包含两篇相同的arXiv论文,详细介绍了一种新的研究方法。
- arXiv
- CORE Recommender
- Face and Voice Cross-modal Association with Learning Convex Feature Embedding
- Hugging Face
- Voxceleb: Large-scale speaker verification in the wild
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →