Zhipu AI 发布了 GLM-5.3-Flash,一个拥有3200亿参数(180亿活跃参数)并支持原生图文模态的模型。该模型采用了混合架构,结合了稀疏和线性注意力机制,以实现高效的长上下文服务。它支持FP8,并根据MIT许可发布,可通过SGLang和vLLM进行部署。 AI
影响 推出了一款具有原生多模态能力和高效长上下文服务能力的新前沿模型,可能对多模态AI发展产生影响。
排序理由 前沿实验室模型发布,附带系统卡。[lever_c_demoted from frontier_release: ic=1 ai=1.0]
在 Mastodon — mastodon.social 阅读 →
- linear attention
- Sparse Attention Acceleration with Synergistic In-Memory Pruning and On-Chip Recomputation
- Zhipu AI
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →