研究人员开发了一个新框架,用于分析多语言语音文本模型如何处理跨模态语言对齐。该框架应用于 SeamlessM4T 和 Qwen2-Audio 等模型,识别出语言选择性神经元,并将其分为表示和控制角色。分析显示,SeamlessM4T 在生成步方面表现出显著的依赖性专业化,跨模态共享的神经元很少,而 Qwen2-Audio 则保持了更广泛的跨模态共享和稳定的对齐。研究还发现,SeamlessM4T 中的语言控制神经元在生成后期会越来越多地将知识从语音转移到文本。 AI
影响 为理解和潜在改进多语言人工智能系统中的跨模态对齐提供了新方法。
排序理由 该集群包含一篇详细介绍新AI模型分析框架的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →