研究人员推出了一种新颖的多模态大语言模型架构Libra,该模型专为理解和生成任务而设计。Libra系统具有独立的视觉和语言组件,通过跨模态桥接连接,允许每个模态发展独特的表示,同时促进有效的跨模态理解。这种解耦方法通过动态路由计算流的开关注意力(switch attention)和开关前馈网络(switch FFN)模块来实现。该架构已在两种配置中进行了评估:Libra-1用于图像到文本理解,Libra-2用于统一的图像到文本理解和文本到图像生成,在两种基准测试中均表现出性能提升。 AI
影响 这种新架构有望为理解和生成任务带来更高效、更强大的多模态AI系统。
排序理由 该集群包含一篇详细介绍新模型架构的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →