IFM发布了K2-Horizon-MoVA-36B-A4B模型,这是一款稀疏专家混合(MoE)模型,采用了值混合注意力(Mixture-of-Values attention)。该模型拥有360亿参数,但每个token仅激活40亿参数,在代理和推理基准测试中取得了超越更大密集模型和MoE模型的前沿级结果。它还支持512K上下文窗口,并将公开其中间检查点、训练数据和代码。 AI
影响 这款稀疏MoE模型展示了在更少活跃参数下具有竞争力,可能影响未来高效模型架构。
排序理由 前沿实验室模型发布,附带系统卡。[lever_c_从frontier_release降级:ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →