IWSLT 2026
PulseAugur coverage of IWSLT 2026 — every cluster mentioning IWSLT 2026 across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
NAVER LABS 为 IWSLT 2026 任务重新实现指令遵循流水线
研究人员为 IWSLT 2026 共享任务重新实现了 NAVER LABS 指令遵循流水线,将其适配为使用 SeamlessM4T-v2-large 作为语音编码器,并使用 Qwen3-4B-Instruct 作为 LLM 主干。此次适配保留了原始的三阶段方法:投影仪对齐、LoRA 预训练和多模态合并。为了增强模型,他们生成了跨越十种语音中心任务类型的 100,000 个合成指令遵循示例。主要模型在 MCIF 基准的 EN-ZH 语音…
-
NAVER LABS Europe 在 IWSLT 2026 语音处理赛道并列第一
NAVER LABS Europe 向 IWSLT 2026 指令遵循语音处理短赛道提交了一个系统,并取得了并列第一的成绩。他们的方法包括一个多阶段训练流程,该流程使用仅包含 ASR 数据的 SpeechMapper 来学习语音到 LLM 的嵌入投影器。此外,他们还开发了一个名为 fakACL 的合成数据集,该数据集使用 SeamlessM4T-large-v2 生成,以提高在科学演讲任务上的性能。这个更新后的系统在性能上超越了去年的…
-
FBK 的 SpeechLLMs 在 IWSLT 2026 指令遵循任务中取得优异成绩
FBK 研究人员为 IWSLT 2026 指令遵循共享任务开发了 SpeechLLMs,重点关注短篇幅和长篇幅语音指令遵循。对于短篇幅任务,他们的模型取得了 2.0708 的 SIFS 分数。在长篇幅任务中,他们探索了各种分段方法,并引入了 HIFS 分数来评估性能,发现固定的 30 秒分段产生了最佳结果,得分为 2.0663。分析表明,长篇幅生成中的幻觉主要涉及重复插入,尽管短篇幅能力基本保持不变。
-
新方法提升同步语音翻译质量与评估水平
研究人员开发了用于评估和改进同步语音翻译系统的新方法,特别针对长篇内容。其中一篇论文介绍了一个实用的评估框架,该框架测量句子级别的延迟和质量指标,揭示了当前系统中显著的延迟累积。另一篇论文提出了一种检索增强方法 (RASST),通过整合特定领域的术语提示来提高翻译质量,从而在准确性和整体翻译方面取得了显著改进。
-
KIT 研究人员通过语言提示增强跨语言语音克隆
KIT 的研究人员开发了一种新颖的跨语言语音克隆方法,这项技术对于语音翻译至关重要。他们的方法基于 FishAudio-S2-Pro 多语言文本到语音模型,并结合了语言标签提示以增强语言控制并最大限度地减少口音的串扰。此外,他们还采用了强化学习进行微调,并引入了参考条件词汇匹配技术来提高专业词汇的发音。
-
新方法利用仅解码器LLM增强同步语音翻译
研究人员正在开发新的同步语音翻译方法,重点关注仅解码器的大型语言模型。一种名为AlignAtt4LLM的方法,通过调整这些模型的注意力机制来提高德语和意大利语等语言的翻译质量,即使在低延迟场景下也是如此。另一种名为DOA的方法,在SpeechLLMs内部使用自注意力机制,在无需重新训练的情况下获得长文本翻译的对齐信号。此外,一个名为Canary的系统,拥有10亿参数,提供了多种语言的离线同步翻译能力。
-
新的泰语语音克隆模型超越人类真实数据和商业旗舰模型
研究人员开发了 JaiTTS-v1.0,一个泰语语音克隆文本到语音模型,取得了最先进的成果,在短时语音生成方面,其词错误率(CER)为1.94%,超越了人类真实数据。该模型改编自VoxCPM,可以直接处理数字和泰英混合语,无需显式文本规范化。在人类评估中,JaiTTS-v1.0在绝大多数配对比较中优于商业旗舰模型。另外,另一项研究专注于科学语音的跨语言语音克隆,评估了基于OmniVoice的模型,并使用数据增强来提高可懂度,同时保持阿…