FlashAttention-2
PulseAugur coverage of FlashAttention-2 — every cluster mentioning FlashAttention-2 across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
Google Cloud 发布用于 AI 代理记忆的开放知识格式
Google Cloud 推出了开放知识格式 (OKF),这是一个旨在帮助 AI 代理保留和访问关键信息的规范。OKF 使用带有 YAML frontmatter 的纯 markdown 文件来存储知识,例如业务定义或系统架构,使其能够被任何代理框架访问。这种方法旨在通过提供一个标准化的、易于维护的知识库来解决 AI 代理忘记上下文的问题,而无需为每个代理定制管道。
-
使用 DeepSeek Harness 和 Unsloth 在本地运行 Qwen 3.8-27B
一份技术指南详细介绍了如何在配备 RTX 3090 显卡的 Windows 11 机器上本地运行 Qwen 3.8-27B 代码模型。该设置利用 DeepSeek Harness 进行代理编排,并利用 Unsloth Engine 进行优化推理,从而实现 100% 私有、低延迟的软件工程代理。该指南强调 RTX 3090 的 24GB VRAM 非常适合托管此类规模的模型,特别是使用一种平衡性能和内存使用的动态量化格式。
-
FlashAttention-2 & 3 应对 LLM 的 GPU 内存限制
本文深入探讨了 FlashAttention-2 和 FlashAttention-3 的技术进步,解释了它们如何克服 GPU 内存带宽的限制。文章详细介绍了算法分块和异步内存管道的使用,以提高效率并有效消除大型语言模型中的上下文墙。
-
GRACE系统通过生成式推荐器加速实时广告检索
一篇新的研究论文介绍GRACE,一个旨在加速生成式推荐器以进行实时广告检索的系统。GRACE通过实现生成式目标匹配(GTM)来改进广告定位,并优化编码器-解码器Transformer以降低延迟和成本,从而解决了资格和计算方面的挑战。该系统在NVIDIA GH200硬件上实现了显著的性能提升,将交叉注意力延迟降低了高达68倍,并将整体解码器延迟降低了11.1倍。
-
已识别微调 VRAM 瓶颈:损失张量消耗大部分内存
一项技术分析显示,在 LoRA 微调过程中,很大一部分 VRAM 被临时的交叉熵损失张量消耗,而不是模型本身。该张量仅短暂存在以产生单个标量输出,在 GPT OSS 20B 等模型中,它占序列长度相关内存使用的 95.2%。对 Unsloth、Axolotl 和 TRL 等微调框架的比较突显了它们在如何管理这个内存密集型张量方面存在主要差异,从而影响了整体 VRAM 效率。
-
Eddy-VL 1.9B: 用于边缘部署的压缩多模态模型
研究人员开发了Eddy-VL 1.9B,这是一种压缩的多模态嵌入模型,专为无云访问环境中的边缘部署而设计。Eddy-VL基于Qwen3-VL-Embedding-2B构建,利用结构化剪枝和分层蒸馏,将参数数量减少了约9.5%,同时在MMEB-V2基准测试中保持了超过91%的教师模型性能。这种压缩还将前向延迟降低了10%,使其适用于需要低延迟和离线功能的应用程序,例如法证调查。虽然在组合推理方面表现强劲,但在Winoground等任务上…
-
Kernelized Linear Attention Boosts Model Capacity and Throughput
研究人员开发了 Kernelized Linear Attention Activations (KATA),一个旨在克服线性注意力模型容量限制的新框架。KATA 利用对称锥和秩一正半定特征来提高联想回忆和状态容量,而无需增加参数。通过融合的 Triton 内核实现,KATA 在处理长序列时,展示出比 FlashAttention-2 高得多的吞吐量,并在需要长距离依赖和精确回忆的任务上,表现出与 Gated DeltaNet 等模型…
-
FlashAttention-3/4优化在消费级RTX GPU上无效
对FlashAttention-3和FlashAttention-4优化的探索发现,这些先进技术不适用于消费级RTX GPU。研究发现,虽然FlashAttention-2在RTX 5090上的表现与现有优化相当,但新版本的性能提升依赖于数据中心特定的硬件,如更快的张量核心指令(WGMMA)和张量内存加速器(TMA),而这些在消费级显卡上并不存在。因此,FlashAttention-2似乎是RTX GPU的性能上限,进一步的提升可能需…
-
Picotron框架支持在旧款GPU上进行LLM训练
一位开发者创建了Picotron,一个专为在旧款GPU上运行而不崩溃而设计的LLM训练框架。该框架消除了强制性的GPU特定依赖,使其能在任何支持PyTorch的GPU上运行。Picotron默认使用标准的PyTorch SDPA,但如果可用,也可以利用FlashAttention-2,并包含各种注意力机制和优化技术的配置。
-
新的Causal-rCM配方加速了自回归视频扩散
研究人员推出了一种新颖的自回归视频扩散蒸馏开放配方Causal-rCM。该框架统一了teacher-forcing和self-forcing范式,以增强流式视频生成和交互式世界模型。Causal-rCM利用连续时间一致性模型和自定义FlashAttention-2内核,实现了比以往方法快10倍的收敛速度。该方法在视频生成方面展示了最先进的性能,一个蒸馏的2步因果Wan2.1-1.3B模型在使用最少采样步数的情况下,在VBench-T2…
-
Subquadratic AI 发布 SubQ 1.1 Small,拥有 1200 万 token 上下文
Subquadratic AI 发布了其新模型 SubQ 1.1 Small,该模型利用智能稀疏注意力(Smart Sparse Attention)在长达 1200 万 token 的范围内实现近乎完美的检索。与标准方法相比,该模型显著降低了计算需求,注意力计算量减少高达 1000 倍。在 100 万 token 的情况下,SubQ 1.1 Small 所需的计算量比 FlashAttention-2 少 64.5 倍,运行速度快 …
-
SubQ 发布 SubQ 1.1 Small,拥有 1200 万 token 上下文和稀疏注意力
SubQ 发布了其 SubQ 1.1 Small 模型,该模型采用了一种新的亚二次稀疏注意力(SSA)架构,旨在克服传统注意力机制的二次方扩展限制。这种新架构显著降低了计算需求,能够处理更长的上下文。在“针尖麦芒”测试中,该模型在高达 1200 万 token 的上下文长度下表现出近乎完美的检索能力,并在通用知识和编码基准测试中表现强劲,同时所需的计算量远低于密集注意力和 FlashAttention-2。
-
字节跳动发布 Bernini 开源视频生成框架
字节跳动发布了 Bernini,一个开源的视频生成和编辑框架。该系统结合了用于语义规划的多模态大语言模型和基于 DiT 的渲染器。据开发者称,根据其内部基准测试,Bernini 在视频编辑任务中取得了顶级性能,可与领先的商业模型相媲美。
-
斯坦福大学的ThunderKittens DSL优化AI内核性能
一篇新文章详细介绍了ThunderKittens,这是斯坦福大学Hazy Research Lab开发的一种紧凑型领域特定语言(DSL),用于创建高性能AI内核。该DSL旨在通过抽象重复的GPU编程任务(如切片布局和内存分配)来平衡研究生产力和硬件效率。这使得开发人员能够密切关注数据移动和调度,同时仍能优化现代AI工作负载在NVIDIA的Hopper和Blackwell等硬件上的性能。
-
Sigmoid attention 改进了生物基础模型,实现了更快、更稳定的训练
研究人员开发了一种名为 Sigmoid Attention 的新注意力机制,该机制在训练生物基础模型方面提供了显著改进。与传统的 softmax attention 相比,这种新颖的方法能够学习到更好的表示,实现高出 25% 的细胞类型分离度和更高的内聚度指标。此外,Sigmoid Attention 能够实现更快的训练,模型完成速度最多可提高 10%,并通过缓解 softmax attention 中固有的问题来增强稳定性。该团队还…
-
Google AI推出LAVA优化云算力,Together AI扩展GPU云,Modal简化AI/ML部署
Google DeepMind的研究人员开发了LAVA,一种新的人工智能驱动的调度算法,旨在优化云数据中心的资源分配。LAVA持续重新预测虚拟机(VM)的生命周期,适应实际使用模式,而不是依赖初始估计。这种方法旨在通过更精确地将虚拟机打包到物理服务器上来减少浪费的容量并提高效率。该系统使用一种受生存分析启发的概率分布模型来处理虚拟机生命周期中的固有不确定性。