研究人员推出了 Mach-Mind-4-Flash,这是一个拥有 350 亿参数的专家混合(MoE)模型,但仅激活 30 亿参数。通过训练后优化,该模型实现了与 1000 亿参数模型相当或更优的性能。该系统采用三阶段流程,包括统一的 RL/OPD 训练基础设施、通过多教师在线策略蒸馏融合的领域特定 RL 专家,以及用于压缩推理链的混合中位数长度策略优化。 AI
影响 通过优化的参数激活和训练技术,在大型语言模型方面展示了显著的效率提升。
排序理由 详细介绍新模型架构和训练方法的技朮报告。
- AIME'26
- arXiv
- Behavioral-SafetyBench
- BFCL-v4
- BrowseComp-zh
- ClawBench
- Hugging Face
- IFBench
- Mach-Mind-4-Flash
- mixture of experts
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →