一款新的视觉语言模型baseten/GLM-5.2-Vision-NVFP4已发布,它将MoonViT视觉编码器与GLM-5.2推理模型集成。该模型通过冻结视觉编码器和文本主干的权重来实现集成,仅有一个新训练的投影仪在两个组件之间映射嵌入。该模型支持大型上下文窗口,在部署于8个Nvidia B200 GPU时支持多达100万个token,并兼容OpenAI的多模态消息格式进行查询。 AI
影响 该模型将视觉能力集成到一个强大的推理模型中,并支持大型上下文窗口,这可能会推动多模态AI应用的发展。
排序理由 来自知名实验室(baseten)的模型发布,包含详细的技术规格和部署说明。[lever_c_demoted from frontier_release: ic=1 ai=1.0]
在 Hugging Face Trending Models 阅读 →
- baseten/GLM-5.2-Vision-NVFP4
- GLM-5.2
- GLM-5.2-Vision
- Kimi K2.6
- MoonViT
- Nvidia B200
- OpenAI
- PatchMerger
- SGLang
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →