PulseAugur
实时 08:15:01
English(EN) Vectorizing the Trie: Efficient Constrained Decoding for LLM-based Generative Retrieval on Accelerators

新的STATIC技术提高了加速器上LLM生成检索的效率

研究人员开发了一种名为STATIC(稀疏转移矩阵加速Trie索引约束解码)的新技术,以提高大型语言模型中生成检索的效率。该方法将不规则的树遍历转化为向量化稀疏矩阵运算,显著加快了在TPU和GPU等硬件加速器上的约束解码速度。在大型视频推荐平台上部署后,STATIC在延迟极小的情况下实现了显著的产品指标改进,与现有的CPU和基线硬件实现相比,速度有了显著提升。 AI

影响 能够更高效、可扩展地在生产环境中部署基于LLM的生成检索系统。

排序理由 该集群描述了学术论文中提出的一种新的技术方法。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的STATIC技术提高了加速器上LLM生成检索的效率

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Zhengyang Su, Isay Katsman, Yueqi Wang, Ruining He, Lukasz Heldt, Raghunandan Keshavan, Shao-Chuan Wang, Xinyang Yi, Mingyan Gao, Onkar Dalal, Lichan Hong, Ed Chi, Ningren Han ·

    向量化Trie:加速器上基于LLM的生成式检索的高效约束解码

    arXiv:2602.22647v2 Announce Type: replace-cross Abstract: Generative retrieval has emerged as a powerful paradigm for LLM-based recommendation. However, industrial recommender systems often benefit from restricting the output space to a constrained subset of items based on busine…