研究人员开发了层级哈希检索(HHR),一个旨在提高大型语言模型(LLM)在生成过程中效率的新框架,尤其是在长上下文场景下。HHR通过引入几何感知键路由(GKR)和学习哈希投影(LHP)来解决传统基于哈希的检索的局限性。这些技术协同工作,通过更好地使汉明距离与实际注意力相关性对齐来提高检索精度,从而减少检索错误。实验表明,HHR在LongBench等基准测试中显著提升了Llama 3.1 8B-Instruct模型的解码速度和整体性能。 AI
影响 提高了LLM在长上下文场景下的推理效率,可能支持更复杂的应用。
排序理由 详细介绍LLM推理新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- Geometry-Aware Key Routing
- Hierarchical Hash Retrieval
- Learned Hash Projection
- Llama 3.1 8B-Instruct
- LLM
- LongBench
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →