实体
hybrid-attention models
hybrid-attention models
PulseAugur coverage of hybrid-attention models — every cluster mentioning hybrid-attention models across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
新的注意力机制提升LLM效率并减少幻觉 · 跟踪10个来源
研究人员正在开发新颖的注意力机制,以提高大型语言模型(LLM)和多模态大型语言模型(MLLM)的效率和能力。这些进展侧重于优化长上下文的稀疏注意力,降低计算成本,并减轻幻觉和视觉基础薄弱等问题。Flash Sparse Attention (FSA)、Information-Regularized Attention (IRA) 和 Multipole Semantic Attention (MuSe) 等技术旨在提高性能、降低延迟,…
-
Moonshot AI论文探讨跨数据中心LLM推理
来自Moonshot AI和清华大学的一篇新论文提出了一种克服大型语言模型服务中“KV壁垒”的方法。该方法称为“Prefill-as-a-Service”,通过使用混合注意力模型减小KV缓存,并实施智能路由仅卸载必要的请求,从而实现跨数据中心推理。这对于计算密集型和带宽优化型芯片未共置的异构硬件设置至关重要。