PulseAugur
实时 02:24:40

新的GLM-5.2 Vision模型集成了MoonViT并支持1M上下文

一款新的视觉语言模型baseten/GLM-5.2-Vision-NVFP4已发布,它将MoonViT视觉编码器与GLM-5.2推理模型集成。该模型通过冻结视觉编码器和文本主干的权重来实现集成,仅有一个新训练的投影仪在两个组件之间映射嵌入。该模型支持大型上下文窗口,在部署于8个Nvidia B200 GPU时支持多达100万个token,并兼容OpenAI的多模态消息格式进行查询。 AI

影响 该模型将视觉能力集成到一个强大的推理模型中,并支持大型上下文窗口,这可能会推动多模态AI应用的发展。

排序理由 来自知名实验室(baseten)的模型发布,包含详细的技术规格和部署说明。[lever_c_demoted from frontier_release: ic=1 ai=1.0]

在 Hugging Face Trending Models 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的GLM-5.2 Vision模型集成了MoonViT并支持1M上下文

报道来源 [1]

  1. Hugging Face Trending Models TIER_1 English(EN) · baseten ·

    baseten/GLM-5.2-Vision-NVFP4

    image-text-to-text · 73 downloads · 61 likes