PulseAugur
实时 11:13:29
实体 FlashAttention2

FlashAttention2

PulseAugur coverage of FlashAttention2 — every cluster mentioning FlashAttention2 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 3
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
  1. RESEARCH · CL_106564 ·

    新的 KV 缓存压缩技术提升大语言模型推理性能 · 跟踪 9 个来源

    多篇研究论文探讨了优化大语言模型(LLM)服务中的键值(KV)缓存的新技术,以解决内存和性能瓶颈。这些方法包括量化、剪枝、合并和频率引导压缩,旨在减少内存使用并提高长上下文工作负载的推理速度。研究评估了这些技术在各种基准测试和模型上的表现,强调了压缩率、任务质量和系统性能之间的权衡,并建议根据工作负载选择压缩策略。

  2. TOOL · CL_71047 ·

    CVPR 2026:深度学习的“标准零件”面临挑战

    研究人员正在挑战深度学习模型的组成部分,质疑诸如注意力机制和量化等领域的既定实践。在CVPR 2026上提出的新研究提出了新方法,例如在注意力计算中使用1位精度,以及为扩散模型开发自动量化策略。此外,一项研究表明,训练扩散模型直接预测干净图像而非噪声,可能提供一种更有效且理论上更合理的方法,从而简化模型架构和训练目标。

  3. TOOL · CL_59508 ·

    CVPR 2026 聚焦深度学习基础组件的审视

    近期研究正在挑战深度学习架构的基本组成部分,特别是在 Transformer 和扩散模型框架内。在 CVPR 2026 上发表的论文探讨了高精度浮点运算和复杂量化策略等标准实践的替代方案。一项研究引入了 BinaryAttention,它使用 1 位精度来实现注意力机制,从而提高了速度并达到了可比的准确性。另一项研究 SegQuant 则自动化了扩散模型的量化参数调整,消除了手动、特定于架构的调整的需要。此外,关于 Just imag…