MOSS-VL 模型家族被推出,作为一个开源的、专为实时交互设计的视觉-语言模型。它通过引入门控交叉注意力来实现这一点,使模型在生成文本的同时处理视觉信息。这些模型使用合成交互语料库和分阶段课程进行训练,专注于主动行为并减少首次标记延迟。MOSS-VL-Realtime 在流式基准测试中表现强劲,在主动行为测试中优于其他开源模型,并且与 Qwen3 VL 8B 等同类模型相比,在首次标记延迟方面具有显著优势。 AI
影响 此次发布为实时视觉-语言任务提供了一个新的开源选项,有可能加速交互式人工智能系统的研究和开发。
排序理由 该集群描述了一个新的开源视觉-语言模型家族的发布,包含技术细节和性能基准,已在 Hugging Face 和 arXiv 上发布。
- arXiv
- Hugging Face
- MOSS-VL
- MOSS-VL-Instruct
- MOSS-VL-Realtime
- OmniMMI Proactive Alerting
- Qwen3 VL 8B
- OpenMOSS
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →