PulseAugur
实时 13:51:25
English(EN) MOSS-VL Technical Report

MOSS-VL 开源视觉-语言模型家族支持实时交互

MOSS-VL 模型家族被推出,作为一个开源的、专为实时交互设计的视觉-语言模型。它通过引入门控交叉注意力来实现这一点,使模型在生成文本的同时处理视觉信息。这些模型使用合成交互语料库和分阶段课程进行训练,专注于主动行为并减少首次标记延迟。MOSS-VL-Realtime 在流式基准测试中表现强劲,在主动行为测试中优于其他开源模型,并且与 Qwen3 VL 8B 等同类模型相比,在首次标记延迟方面具有显著优势。 AI

影响 此次发布为实时视觉-语言任务提供了一个新的开源选项,有可能加速交互式人工智能系统的研究和开发。

排序理由 该集群描述了一个新的开源视觉-语言模型家族的发布,包含技术细节和性能基准,已在 Hugging Face 和 arXiv 上发布。

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →

MOSS-VL 开源视觉-语言模型家族支持实时交互

报道来源 [2]

  1. Hugging Face Daily Papers TIER_1 English(EN) ·

    MOSS-VL 技术报告

    MOSS-VL is an open vision-language model family enabling real-time interaction by attending to vision via gated cross-attention during generation, using a synthesized interaction corpus and staged curriculum to achieve strong streaming performance with reduced time-to-first-token…

  2. arXiv cs.CV TIER_1 English(EN) · Pengyu Wang, Chenkun Tan, Shaojun Zhou, Qirui Zhou, Yanxin Chen, Xingyang He, Huazheng Zeng, Jijun Cheng, Chenghao Wang, Xiaomeng Qian, Pengfei Wang, Zhan Huang, Shanqing Gao, Wei Huang, Longjun Cao, Wu Ran, Jie Liu, Changtai Zhu, Hongkai Wang, Yixian Ti… ·

    MOSS-VL 技术报告

    arXiv:2608.15045v1 Announce Type: new Abstract: We present MOSS-VL, an open vision-language model family that treats real-time interaction -- perceiving while it speaks -- as a first-class capability. It is co-designed across the stack: the language decoder attends to vision only…