两篇新研究论文探讨了优化大型语言模型 (LLM) 性能和效率的先进方法。第一篇论文介绍了一种延迟感知的查询路由系统,该系统联合考虑延迟、准确性和成本,在准确性-成本效用方面取得了高达 40% 的提升。第二篇论文“Mediator”提出了一种内存高效的 LLM 合并技术,该技术解决了参数冲突问题,并使用基于不确定性的路由,在 LLaMA 和 Qwen 模型上展示了在降低系统成本的同时显著提升性能。 AI
影响 这些研究论文提出了提高 LLM 效率和性能的新颖技术,有望实现更快、更具成本效益的 AI 部署。
排序理由 两篇在 arXiv 上发表的学术论文,详细介绍了 LLM 优化的新方法。
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- LLaMA
- LLM
- Mediator
- Qwen
- ScienceCast
- Xinglin Pan
- Latency-Aware LLM Query Routing for Dynamic Workloads
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →