研究人员推出MOSS-VL,这是一个新颖的开源视觉语言模型系列,专为实时交互而设计。该模型的架构使其能够一边说话一边感知视觉输入,并利用门控交叉注意力机制和合成交互语料库进行训练。MOSS-VL-Realtime在流式基准测试中表现出色,尤其是在主动行为方面,在OmniMMI主动警报等指标上优于现有的开源模型。尽管MOSS-VL拥有113亿参数,但与Qwen3 VL 8B等同类模型相比,它在首个token的生成时间上具有显著优势,尤其是在视觉上下文增加的情况下。 AI
影响 这项研究引入了一种新的实时视觉语言交互架构,有望提高多模态AI系统中智能体的响应能力和主动性。
排序理由 该集群描述了一篇介绍新模型系列的最新研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →