LRS3
PulseAugur coverage of LRS3 — every cluster mentioning LRS3 across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
SyncVoice框架通过视觉增强的TTS提升视频配音效果
研究人员开发了SyncVoice,一个新颖的自动视频配音框架,可增强语音的自然度和与视觉内容的暂时同步性。通过将文本-视觉融合模块集成到预训练的文本到语音系统中,SyncVoice将视觉特征与语言表示相结合,实现同步语音合成。在LRS3数据集上的实验证明了其在零样本配音方面的最先进性能,并且在双语数据集上的进一步训练使单个模型能够同时进行中文和英文配音。
-
新的Candor-LR数据集推动视听语音识别走向自然对话
研究人员推出了Candor-LR,这是一个旨在通过模拟自然对话来推进视听语音识别(AVSR)的新数据集。与使用脚本语音的LRS3等现有基准不同,Candor-LR源自真实的视频会议,并包含重叠语音和自发对话等功能。初步评估表明,虽然与LRS3相比,Candor-LR上的纯音频性能有所下降,但视觉线索显著提高了准确性,凸显了多模态方法在现实语音识别中的重要性。
-
新的AVSRBench基准揭示语音识别中的泛化差距
研究人员开发了AVSRBench,一个旨在评估视听语音识别(AVSR)系统在标准广播语音之外的各种挑战性条件下的新基准。研究发现,当前的AVSR架构在泛化方面存在困难,在涉及过度发音、朗读语音和即兴对话的任务上性能显著下降。视觉理解在侧面视图下也会失效,多模态系统通常严重依赖声学回退。研究强调,说话人的发音比轻微的摄像头移动更关键,基于LLM的架构表现出较差的域外泛化能力。为了促进更好的评估,AVSRBench和统一的数据预处理流程已被引入。
-
新方法提升基于LLM的视听语音识别
研究人员开发了一种名为注意力引导可靠性缩放(AGRS)的新方法,以改进使用大型语言模型的视听语音识别(AVSR)系统。该技术通过根据注意力信号和预测发散动态调整对比强度来适应对比解码,后者对比了仅音频和视听条件。在LRS3数据集上的实验表明,AGRS在干净和嘈杂的音频条件下都能提高性能。
-
新的DoubleHelix框架改进了视听语音识别
研究人员推出了一种新颖的视听语音识别(AVSR)框架DoubleHelix,它增强了音频和视觉数据的融合。与将跨模态交互视为单一步骤的先前方法不同,DoubleHelix采用迭代过程,具有自适应、抗退化增强功能。该方法包括多轮结构化交互、学习对齐约束和一致性引导特征增强等组件。在LRS3数据集上的实验表明,DoubleHelix在干净音频上实现了0.68%的词错误率(WER),显著优于现有方法,并在嘈杂条件下表现出增强的鲁棒性。
-
新框架可根据面部图像生成语音
研究人员开发了一个新颖的面部到语音(F2S)框架,能够从静态面部图像生成逼真的声音,克服了文本到语音(TTS)系统需要参考音频的限制。该系统利用一个轻量级的面部适配器,将面部识别特征与冻结的StyleTTS 2模型的风格空间对齐。在LRS3数据集上的评估表明,合成语音高度自然,声音生成一致,并且面部到语音检索的准确率高于随机水平。值得注意的是,一个英语训练的适配器也能生成流利的西班牙语语音,这表明面部到风格的映射在很大程度上是与语言无关的。
-
新的VSR方法利用头部姿态提高准确性
研究人员开发了一个名为HP-VSR-ResFiLM的新框架,通过显式地整合头部姿态信息来改进视觉语音识别(VSR)。该方法使用一个姿态条件残差特征线性调制(FiLM)块,根据头部方向调整视觉特征,以应对几何失真和遮挡等挑战。在LRS2和LRS3数据集上的实验显示出具有竞争力的性能,词错误率分别为25.0%和33.2%,证明了在非约束VSR场景下鲁棒性的提高。