研究人员开发了 CHIME,一个旨在提高大型语言模型中长上下文注意力操作效率的新颖系统。CHIME 集成了 DIMM-PIM 技术,该技术提供了可扩展容量和带宽的平衡,解决了先前注意力-FC 分离 (AFD) 系统中的局限性。该系统采用无气泡流水线和混合粒度重新布局等先进技术来管理分布式 DRAM 芯片并优化注意力计算。评估表明,与现有的 HBM-PIM 解决方案相比,CHIME 的速度最多可提高 5.15 倍。 AI
影响 提高 LLM 推理效率,可能降低长上下文应用的成本和延迟。
排序理由 该条目在一篇学术论文中描述了一个用于提高 LLM 推理效率的新系统和模型。[lever_c_demoted from research: ic=1 ai=1.0]
- Attention-FC Disaggregated (AFD)
- CHIME
- DIMM-PIM
- Disaggregated Roofline Model (DRM)
- HBM-PIM
- Qingyuan Liu
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →