小米开发了MiMo-V2-Flash,一个拥有3090亿参数的混合专家(MoE)模型,在编码任务的SWE-Bench上领先于其他开源选项。该模型通过混合注意力(hybrid attention)和用于更快解码的多令牌预测模块(multi-token prediction module)等架构创新,以显著降低的计算成本实现了高性能。此外,一种名为多教师策略优化蒸馏(Multi-Teacher On-Policy Distillation)的新颖训练后技术,使模型能够从多个专业教师那里高效学习,进一步降低了训练费用。 AI
影响 为高效的大型语言模型(LLM)开发树立了新标准,可能降低高性能开源模型的门槛。
排序理由 小米发布了一个新的、高参数的大型语言模型,在重要基准测试中名列前茅。 [lever_c_demoted from frontier_release: ic=2 ai=1.0]
- Chaintin
- Hugging Face
- llama
- MiMo-7B
- MiMo-7B-RL
- MiMo-V2.5
- MiMo-V2.5-Pro
- MiMo-V2-Flash
- mistral.ai
- MonkeyCode
- Ollama
- Xiaomi
- Xiaomi MiMo
- Mixture of Experts
- Multi-Teacher On-Policy Distillation
- Multi Token Prediction
- sliding-window attention
- SWE-Bench Multilingual
- SWE-Bench Verified
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →