研究人员开发了一种名为 Mediator 的新方法,用于更有效地合并大型语言模型 (LLM)。该技术解决了传统平均方法中由参数冲突引起的性能下降问题。Mediator 选择性地平均冲突最小的层,并对冲突显著的层采用任务级专家路由,同时解耦专家以降低存储成本。该方法还结合了任务不确定性,为分布外样本选择和合并合适的专家,在 LLaMA 和 Qwen 模型上展示了性能提升,并降低了系统成本。 AI
影响 这项研究提供了一种更有效的方法来组合 LLM,有望为各种任务带来更强大、更具成本效益的模型。
排序理由 该集群包含一篇研究论文,详细介绍了一种新的 LLM 合并方法。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- LLaMA
- LLM
- Mediator
- Qwen
- ScienceCast
- Xinglin Pan
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →