AMD 发布了 Instella-MoE-16B-A3B-Think,这是一款新的开源专家混合(Mixture-of-Experts)语言模型。该模型拥有 160 亿总参数,每个 token 有 28 亿激活参数,并在 AMD Instinct MI300X 和 MI325X GPU 上从头开始训练。发布内容包括所有训练阶段的检查点,并提供了与 Transformers 和 vLLM 等流行库以及 SGLang 和 Docker 等工具集成的说明。 AI
影响 为研究人员和开发人员提供了一个新的开源 MoE 模型,有望推动模型架构和效率的创新。
排序理由 主要硬件供应商发布新开源模型。 [lever_c_demoted from frontier_release: ic=1 ai=1.0]
在 Hugging Face Trending Models 阅读 →
- AMD
- amd/Instella-MoE-16B-A3B-Think
- AMD Instinct MI300X
- AMD Instinct MI325X
- Docker
- Hugging Face
- SGLang
- Transformers
- vLLM
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →