OpenMOSS
PulseAugur coverage of OpenMOSS — every cluster mentioning OpenMOSS across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
MOSS-VL 开源视觉-语言模型家族支持实时交互
MOSS-VL 模型家族被推出,作为一个开源的、专为实时交互设计的视觉-语言模型。它通过引入门控交叉注意力来实现这一点,使模型在生成文本的同时处理视觉信息。这些模型使用合成交互语料库和分阶段课程进行训练,专注于主动行为并减少首次标记延迟。MOSS-VL-Realtime 在流式基准测试中表现强劲,在主动行为测试中优于其他开源模型,并且与 Qwen3 VL 8B 等同类模型相比,在首次标记延迟方面具有显著优势。
-
OpenMOSS-Team发布MOSS-VL-Realtime,用于连续视频流理解
OpenMOSS-Team发布了MOSS-VL-Realtime,这是一款专为连续视频流理解设计的新模型。与一次性处理整个视频的传统模型不同,MOSS-VL-Realtime实时处理传入的帧,允许在流的任何时间点提问。该模型在视觉证据不足时也可以选择保持沉默,并且可以随着新帧的处理动态更新其响应。它保持256K的文本上下文窗口,并利用具有时间戳感知帧编码的交叉注意力架构来改进时间推理。
-
开源AI管线可在本地生成游戏资产
一位开发者创建了一个使用开源AI模型在本地生成游戏资产的完整管线,并已移植到GGML以实现本地执行。该管线包括用于文本转语音及语音克隆(OpenMOSS)、音效生成(ThinkSound.cpp)以及最先进的3D模型生成(Trellis.2)的工具。这些工具已集成到Lemonade SDK中,通过级联模型实现文本到3D生成等复杂工作流。整个系统基于宽松的开源许可证构建,并支持CUDA、Vulkan和ROCm以实现广泛的硬件兼容性。
-
开源音频模型MOSS-Audio发布;微软与OpenAI终止AGI协议
OpenMOSS发布了MOSS-Audio 2026,这是一个开源的基础模型,能够处理语音、环境声音和音乐,并理解时间推理。据报道,该模型在通用音频基准测试中表现优于大型专有系统。另外,微软和OpenAI之间合作协议中的历史性AGI条款已被终止,这标志着他们合作关系发生了重大转变。