研究人员开发了hLLM,一种用于大型语言模型(LLM)的新型解码策略,可显著加快生成式重排的速度。通过将输出视为一个可用匈牙利算法解决的排列问题,hLLM实现了$64 imes$的端到端推理加速,将其缩短至28毫秒。该方法保持了与现有教师模型相当的排名质量,并将生成式排名与组合优化联系起来。 AI
影响 这种新的解码策略可以为基于LLM的排名系统实现实时应用。
排序理由 该集群包含一篇详细介绍LLM解码新方法的论文。
- arXiv
- Hungarian algorithm
- large language models
- LoRA+
- alphaXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- IArxiv
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →