一位用户从头开始训练了一个名为 Apex-2 的 3.87B 参数混合专家(MoE)模型,使用了 865 亿个 token 进行预训练,并额外使用了 25 亿个 token 进行监督微调。该模型采用解码器式 MoE 架构,拥有 16 个专家,每个 token 活跃参数量为 14.5 亿,支持 4096 token 的上下文窗口。虽然 Apex-2 在编码基准测试中表现具有竞争力,在预训练数据量远少于 Qwen2.5-1.5B 的情况下与其相当,但由于预训练数据集有限,它在知识密集型任务上表现不佳,并出现频繁的幻觉。 AI
影响 展示了高效训练小型 MoE 模型的能力,可能使定制模型开发更加普及。
排序理由 用户训练的模型发布,包含详细的技术规格和基准测试结果。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →