华为已开源其新的混合专家(MoE)模型 openPangu-2.0-Pro。该模型拥有总计5050亿参数,其中180亿参数被激活,并支持512,000个 token 的上下文长度。它在34万亿个 token 上进行了训练,并采用了先进的训练技术,包括用于慢速和快速思考的统一 SFT、多专家 RL 训练以及 on-policy 蒸馏。 AI
影响 此次开源为研究人员和开发人员提供了一个强大的新型 MoE 模型,有望加速高效大型语言模型的开发和部署方面的进展。
排序理由 一家主要科技公司发布大型语言模型的开源版本。[lever_c_研究降级:ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →