两篇新研究论文探讨了专家混合(MoE)模型的复杂性,特别是关于校准和不连续性。第一篇论文研究了专家级校准如何在分布变化下影响MoE性能,并提出了一种对抗性重加权方法来提高软路由模型的准确性和校准性。第二篇论文对稀疏专家混合(SMoE)架构中的不连续性进行了严格的几何和随机分析,发现低阶不连续性占主导地位,并提出了一种平滑机制来增强语言和视觉任务中的连续性和经验性能。 AI
影响 这些研究为MoE模型的行为提供了理论见解,有望在语言和视觉任务中带来更强大、更准确的AI系统。
排序理由 该集群包含两篇在arXiv上发表的学术论文,讨论了专家混合模型的理论方面。
- arXiv
- diffusion process
- Hugging Face
- Language Models
- Sparse Mixture of Experts
- Vision Models
- alphaXiv
- CatalyzeX Code Finder for Papers
- CORE Recommender
- DagsHub
- fontange
- Gotit.pub
- Influence Flower
- mixture of experts
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 4 个来源。 我们如何撰写摘要 →