PulseAugur
中
实时 18:28:35
实体 FlashAttention-2

FlashAttention-2

PulseAugur coverage of FlashAttention-2 — every cluster mentioning FlashAttention-2 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
18
90 天内 18
发布 · 30天
0
90 天内 0
论文 · 30天
9
90 天内 9
层级分布 · 90 天
主题
关系
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 20 条
  1. TOOL · CL_284515 ·

    WavePrune方法增强RoPE,提升LLM长上下文性能

    研究人员推出了一种名为WavePrune的新方法,用于改进大型语言模型中的旋转位置嵌入(RoPE)。RoPE的周期性可能导致位置混叠,使模型难以区分某些相对位置。WavePrune通过将每个通道限制在其第一个旋转周期内来解决这个问题,这已被证明可以增强注意力图并改善长上下文性能。该方法在Qwen3_8B等模型上展示了性能提升,在推断长度下取得了更高的HELMET分数和更低的验证损失。此外,与FlashAttention-2相比,Wav…

  2. RESEARCH · CL_268943 ·

    新研究推动表格基础模型实现高效和鲁棒性

    多篇研究论文探讨了表格基础模型(TFMs)的进展,重点关注提高其效率、鲁棒性和适应性。知识蒸馏等技术正被用于从大型TFM创建更小、更快的学生模型,而RelICL和VIP-COP等新方法则解决了关系学习和上下文优化中的挑战。此外,研究正在探索架构选择和参数高效适应策略,以增强TFM在亚群体偏移和大规模数据集等各种数据条件下的性能。

  3. TOOL · CL_233566 ·

    新框架为LLM注意力实现精确内存溢出恢复

    研究人员开发了Stream-CQSA,一个旨在克服长上下文大型语言模型中内存溢出(OOM)限制的新颖框架。该方法利用CQS分解将注意力调用递归地划分为更小、可管理的子序列任务。通过独立执行这些任务然后重新组合结果,即使原始调用会超出设备内存,Stream-CQSA也能恢复完整的注意力输出。虽然与FlashAttention-2等优化内核相比,它会产生运行时开销,但它成功地防止了OOM故障,从而能够处理更长的序列。

  4. RESEARCH · CL_245547 ·

    新方法大幅缩小LLM规模并提升推理速度

    研究人员开发了两种新颖的方法,可在不显著损失性能的情况下大幅减小大型语言模型(LLM)的规模和计算成本。Squeeze10-LLM采用分阶段混合精度量化框架,通过将大部分权重量化到1比特,其余量化到4比特,实现了平均每权重1.6比特,提高了零样本任务的准确性。HyQuant专注于优化注意力模块,通过保留关键的“垂直线”令牌和局部窗口以高精度,同时量化剩余状态,从而在各种模型上实现更快的推理和更少的内存使用。

  5. TOOL · CL_216722 ·

    Google Cloud 发布用于 AI 代理记忆的开放知识格式

    Google Cloud 推出了开放知识格式 (OKF),这是一个旨在帮助 AI 代理保留和访问关键信息的规范。OKF 使用带有 YAML frontmatter 的纯 markdown 文件来存储知识,例如业务定义或系统架构,使其能够被任何代理框架访问。这种方法旨在通过提供一个标准化的、易于维护的知识库来解决 AI 代理忘记上下文的问题,而无需为每个代理定制管道。

  6. TOOL · CL_204944 ·

    使用 DeepSeek Harness 和 Unsloth 在本地运行 Qwen 3.8-27B

    一份技术指南详细介绍了如何在配备 RTX 3090 显卡的 Windows 11 机器上本地运行 Qwen 3.8-27B 代码模型。该设置利用 DeepSeek Harness 进行代理编排,并利用 Unsloth Engine 进行优化推理,从而实现 100% 私有、低延迟的软件工程代理。该指南强调 RTX 3090 的 24GB VRAM 非常适合托管此类规模的模型,特别是使用一种平衡性能和内存使用的动态量化格式。

  7. TOOL · CL_197866 ·

    FlashAttention-2 & 3 应对 LLM 的 GPU 内存限制

    本文深入探讨了 FlashAttention-2 和 FlashAttention-3 的技术进步,解释了它们如何克服 GPU 内存带宽的限制。文章详细介绍了算法分块和异步内存管道的使用,以提高效率并有效消除大型语言模型中的上下文墙。

  8. RESEARCH · CL_180200 ·

    GRACE系统通过生成式推荐器加速实时广告检索

    一篇新的研究论文介绍GRACE,一个旨在加速生成式推荐器以进行实时广告检索的系统。GRACE通过实现生成式目标匹配(GTM)来改进广告定位,并优化编码器-解码器Transformer以降低延迟和成本,从而解决了资格和计算方面的挑战。该系统在NVIDIA GH200硬件上实现了显著的性能提升,将交叉注意力延迟降低了高达68倍,并将整体解码器延迟降低了11.1倍。

  9. TOOL · CL_170337 ·

    已识别微调 VRAM 瓶颈:损失张量消耗大部分内存

    一项技术分析显示,在 LoRA 微调过程中,很大一部分 VRAM 被临时的交叉熵损失张量消耗,而不是模型本身。该张量仅短暂存在以产生单个标量输出,在 GPT OSS 20B 等模型中,它占序列长度相关内存使用的 95.2%。对 Unsloth、Axolotl 和 TRL 等微调框架的比较突显了它们在如何管理这个内存密集型张量方面存在主要差异,从而影响了整体 VRAM 效率。

  10. TOOL · CL_154581 ·

    Eddy-VL 1.9B: 用于边缘部署的压缩多模态模型

    研究人员开发了Eddy-VL 1.9B,这是一种压缩的多模态嵌入模型,专为无云访问环境中的边缘部署而设计。Eddy-VL基于Qwen3-VL-Embedding-2B构建,利用结构化剪枝和分层蒸馏,将参数数量减少了约9.5%,同时在MMEB-V2基准测试中保持了超过91%的教师模型性能。这种压缩还将前向延迟降低了10%,使其适用于需要低延迟和离线功能的应用程序,例如法证调查。虽然在组合推理方面表现强劲,但在Winoground等任务上…

  11. TOOL · CL_154023 ·

    Kernelized Linear Attention Boosts Model Capacity and Throughput

    研究人员开发了 Kernelized Linear Attention Activations (KATA),一个旨在克服线性注意力模型容量限制的新框架。KATA 利用对称锥和秩一正半定特征来提高联想回忆和状态容量,而无需增加参数。通过融合的 Triton 内核实现,KATA 在处理长序列时,展示出比 FlashAttention-2 高得多的吞吐量,并在需要长距离依赖和精确回忆的任务上,表现出与 Gated DeltaNet 等模型…

  12. TOOL · CL_135514 ·

    FlashAttention-3/4优化在消费级RTX GPU上无效

    对FlashAttention-3和FlashAttention-4优化的探索发现,这些先进技术不适用于消费级RTX GPU。研究发现,虽然FlashAttention-2在RTX 5090上的表现与现有优化相当,但新版本的性能提升依赖于数据中心特定的硬件,如更快的张量核心指令(WGMMA)和张量内存加速器(TMA),而这些在消费级显卡上并不存在。因此,FlashAttention-2似乎是RTX GPU的性能上限,进一步的提升可能需…

  13. TOOL · CL_113992 ·

    Picotron框架支持在旧款GPU上进行LLM训练

    一位开发者创建了Picotron,一个专为在旧款GPU上运行而不崩溃而设计的LLM训练框架。该框架消除了强制性的GPU特定依赖,使其能在任何支持PyTorch的GPU上运行。Picotron默认使用标准的PyTorch SDPA,但如果可用,也可以利用FlashAttention-2,并包含各种注意力机制和优化技术的配置。

  14. RESEARCH · CL_109474 ·

    新的Causal-rCM配方加速了自回归视频扩散

    研究人员推出了一种新颖的自回归视频扩散蒸馏开放配方Causal-rCM。该框架统一了teacher-forcing和self-forcing范式,以增强流式视频生成和交互式世界模型。Causal-rCM利用连续时间一致性模型和自定义FlashAttention-2内核,实现了比以往方法快10倍的收敛速度。该方法在视频生成方面展示了最先进的性能,一个蒸馏的2步因果Wan2.1-1.3B模型在使用最少采样步数的情况下,在VBench-T2…

  15. SIGNIFICANT · CL_94984 ·

    Subquadratic AI 发布 SubQ 1.1 Small,拥有 1200 万 token 上下文

    Subquadratic AI 发布了其新模型 SubQ 1.1 Small,该模型利用智能稀疏注意力(Smart Sparse Attention)在长达 1200 万 token 的范围内实现近乎完美的检索。与标准方法相比,该模型显著降低了计算需求,注意力计算量减少高达 1000 倍。在 100 万 token 的情况下,SubQ 1.1 Small 所需的计算量比 FlashAttention-2 少 64.5 倍,运行速度快 …

  16. SIGNIFICANT · CL_95036 ·

    SubQ 发布 SubQ 1.1 Small,拥有 1200 万 token 上下文和稀疏注意力

    SubQ 发布了其 SubQ 1.1 Small 模型,该模型采用了一种新的亚二次稀疏注意力(SSA)架构,旨在克服传统注意力机制的二次方扩展限制。这种新架构显著降低了计算需求,能够处理更长的上下文。在“针尖麦芒”测试中,该模型在高达 1200 万 token 的上下文长度下表现出近乎完美的检索能力,并在通用知识和编码基准测试中表现强劲,同时所需的计算量远低于密集注意力和 FlashAttention-2。

  17. SIGNIFICANT · CL_65070 ·

    字节跳动发布 Bernini 开源视频生成框架

    字节跳动发布了 Bernini,一个开源的视频生成和编辑框架。该系统结合了用于语义规划的多模态大语言模型和基于 DiT 的渲染器。据开发者称,根据其内部基准测试,Bernini 在视频编辑任务中取得了顶级性能,可与领先的商业模型相媲美。

  18. RESEARCH · CL_43418 ·

    斯坦福大学的ThunderKittens DSL优化AI内核性能

    一篇新文章详细介绍了ThunderKittens,这是斯坦福大学Hazy Research Lab开发的一种紧凑型领域特定语言(DSL),用于创建高性能AI内核。该DSL旨在通过抽象重复的GPU编程任务(如切片布局和内存分配)来平衡研究生产力和硬件效率。这使得开发人员能够密切关注数据移动和调度,同时仍能优化现代AI工作负载在NVIDIA的Hopper和Blackwell等硬件上的性能。

  19. RESEARCH · CL_11887 ·

    Sigmoid attention 改进了生物基础模型,实现了更快、更稳定的训练

    研究人员开发了一种名为 Sigmoid Attention 的新注意力机制,该机制在训练生物基础模型方面提供了显著改进。与传统的 softmax attention 相比,这种新颖的方法能够学习到更好的表示,实现高出 25% 的细胞类型分离度和更高的内聚度指标。此外,Sigmoid Attention 能够实现更快的训练,模型完成速度最多可提高 10%,并通过缓解 softmax attention 中固有的问题来增强稳定性。该团队还…

  20. RESEARCH · CL_00277 ·

    Google AI推出LAVA优化云算力,Together AI扩展GPU云,Modal简化AI/ML部署

    Google DeepMind的研究人员开发了LAVA,一种新的人工智能驱动的调度算法,旨在优化云数据中心的资源分配。LAVA持续重新预测虚拟机(VM)的生命周期,适应实际使用模式,而不是依赖初始估计。这种方法旨在通过更精确地将虚拟机打包到物理服务器上来减少浪费的容量并提高效率。该系统使用一种受生存分析启发的概率分布模型来处理虚拟机生命周期中的固有不确定性。