研究人员开发了 OmniFusion,一种新颖的同步多语言多模态翻译方法。该方法将预训练的多模态基础模型 (MMFMs) 与专用的翻译大型语言模型 (LLMs) 融合,创建一个端到端系统。OmniFusion 使用 Omni 2.5-7B 作为 MMFM,SeedX PPO-7B 作为翻译 LLM 构建,可以处理语音到文本、语音和图像到文本以及文本和图像到文本的翻译。实验表明,与级联流水线相比,它将同步语音翻译的延迟减少了一秒,并通过有效利用音频和视觉输入提高了整体翻译质量。 AI
影响 通过整合视觉和音频数据,实现更高效、更具上下文感知能力的翻译,有可能改善跨语言的实时通信。
排序理由 该集群包含一篇详细介绍多模态翻译新模型和方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →