研究人员评估了用于在嘈杂环境中(特别是鸡尾酒会场景)预测对话轮流的视听模型。研究发现,在干净数据上训练的模型在暴露于重叠语音和背景干扰时,性能显著下降。虽然微调提高了鲁棒性,但收益因模态和预训练数据的量而异,这凸显了音频和视觉线索在适应复杂人类互动方面的差异。 AI
影响 强调了将AI模型应用于现实世界嘈杂对话数据的挑战,表明需要更鲁棒的适应策略。
排序理由 该项目是一篇在arXiv上发表的研究论文,详细介绍了视听模型的实验。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →