PulseAugur
实时 09:25:20
English(EN) CHIME: A Case for Efficient Long-Context Attention-FC Disaggregated Inference with DIMM-PIM

CHIME 系统利用 DIMM-PIM 提升 LLM 长上下文注意力推理效率

研究人员开发了 CHIME,一个旨在提高大型语言模型中长上下文注意力操作效率的新颖系统。CHIME 集成了 DIMM-PIM 技术,该技术提供了可扩展容量和带宽的平衡,解决了先前注意力-FC 分离 (AFD) 系统中的局限性。该系统采用无气泡流水线和混合粒度重新布局等先进技术来管理分布式 DRAM 芯片并优化注意力计算。评估表明,与现有的 HBM-PIM 解决方案相比,CHIME 的速度最多可提高 5.15 倍。 AI

影响 提高 LLM 推理效率,可能降低长上下文应用的成本和延迟。

排序理由 该条目在一篇学术论文中描述了一个用于提高 LLM 推理效率的新系统和模型。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

CHIME 系统利用 DIMM-PIM 提升 LLM 长上下文注意力推理效率

报道来源 [1]

  1. arXiv cs.LG TIER_1 English(EN) · Qingyuan Liu, Liyan Chen, Haocheng Wang, Yanning Yang, Dong Du, Zhigang Mao, Naifeng Jing, Yubin Xia, Haibo Chen ·

    CHIME:一种用于DIMM-PIM的高效长上下文注意力-FC分解推理的案例

    arXiv:2504.17584v2 Announce Type: replace-cross Abstract: Attention-FC Disaggregated (AFD) LLM inference systems offload memory-bound Attention operations to memory-rich accelerators (e.g., CPUs, HBM-PIM) while retaining compute-bound Fully-Connected (FC) operations on GPUs. In t…