DeepSeek 发布了其 V4 多模态模型的权重和参考代码,允许研究人员检查其视觉处理能力。与简单的图像到文本的附加功能不同,V4 将视觉 token 直接集成到其现有架构中,使其能够参与注意力机制、专家混合(MoE)路由和代理推理。该模型采用 Vision Transformer (ViT) 进行初始编码,然后使用 Aligner 将视觉特征压缩并映射到语言模型的空间中。V4 内的专用机制处理视觉 token,包括修改后的注意力规则和不同的 MoE 路由偏差,以更好地保留长上下文框架内图像的空间关系和计算需求。 AI
影响 能够对多模态集成和代理能力进行更深入的研究。
排序理由 前沿实验室模型发布,包含权重和参考代码。[lever_c_从 frontier_release 降级:ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →