FlashAttention-4
PulseAugur coverage of FlashAttention-4 — every cluster mentioning FlashAttention-4 across labs, papers, and developer communities, ranked by signal.
- 2026-05-22 product_launch Together AI released FlashAttention-4, an optimized algorithm for Blackwell GPUs. 来源
2 天有情绪数据
-
新的多项式近似提高了在NVIDIA Blackwell GPU上训练大语言模型的速度
研究人员开发了用于大语言模型(LLMs)中超越函数的新多项式近似方法,以提高计算效率。这些近似方法在NVIDIA Blackwell GPU上进行了测试,在孤立的内核操作中显示出从1.19倍到2.19倍的显著加速。当集成到LLM训练任务中时,这些替换方法在整体训练吞吐量方面带来了明显的改进,某些任务的增益高达8.0%。该研究还评估了这些近似方法对模型行为的影响,发现与原生实现相比,最终训练损失的差异很小。
-
新研究推动表格基础模型实现高效和鲁棒性
多篇研究论文探讨了表格基础模型(TFMs)的进展,重点关注提高其效率、鲁棒性和适应性。知识蒸馏等技术正被用于从大型TFM创建更小、更快的学生模型,而RelICL和VIP-COP等新方法则解决了关系学习和上下文优化中的挑战。此外,研究正在探索架构选择和参数高效适应策略,以增强TFM在亚群体偏移和大规模数据集等各种数据条件下的性能。
-
新的 FlashAttention-4 方法在 Blackwell 硬件上提升了 FP4 性能
研究人员开发了一种名为 Direct-P 的新方法,用于优化 FlashAttention-4 在 Blackwell 的 4 位浮点 (FP4) 张量核心上的性能,解决了由 softmax 转换和片上依赖引起的性能瓶颈。对于非因果推理,Direct-P 将分数直接映射到 FP4 概率,在 NVIDIA GB200 硬件上实现了高达 bfloat16 2.13 倍的吞吐量。因果训练路径通过 FP8 梯度操作数重建概率,将 80 亿参数…
-
新研究探索大语言模型效率和推理能力的提升
多篇研究论文探讨了提高大语言模型(LLMs)效率和可靠性的方法。Hugging Face 的 LFM2.5-DSpark 通过使用推测性解码技术,展示了高达 3.2 倍的推理速度提升。OpWeave 和 LayerRoute 分别提出了用于跨异构硬件优化大语言模型服务和实现自适应层跳过的框架。其他研究则关注大语言模型的推理和校准,其中 ZebraArena 为工具增强型大语言模型提供了诊断环境,而 Efficiency Halluci…
-
新的X-Stage流水线优化提升DiT推理速度
研究人员发现了一个新的流水线阶段,称为X-Stage,可以优化扩散Transformer(DiT)推理过程中的通信-计算重叠。该阶段专注于通信启动后但尚未完全可见的期间,从而更好地预测和管理发送方背压。通过对这个X-Stage进行建模,研究人员重新设计了DeepGEMM MegaMoE和Ulysses序列并行注意力模型的通信-计算融合内核,与现有基线相比实现了显著的加速。
-
Together AI 发布 Inkling 多模态 MoE 模型,拥有 100 万上下文窗口
Together AI 推出了 Inkling,这是由 Thinking Machines Lab 开发的多模态混合专家(MoE)模型。该开放权重模型拥有 9750 亿总参数和 410 亿激活参数,100 万 token 的上下文窗口,并原生支持文本、图像和音频输入。Inkling 通过 Together 的 FlashAttention-4 内核进行了优化,以实现高效推理,现在可通过 Together Serverless Infe…
-
Thinking Machines Lab 发布 Inkling 多模态模型,支持可控推理
Thinking Machines Lab 推出了 Inkling,这是一款专为高效推理和多功能任务处理而设计的新型多模态模型。该模型接受文本、图像和音频输入,并具有可控的推理能力,以平衡推理深度与延迟和 token 使用量。Inkling 包含多项架构创新,包括混合专家(mixture-of-experts)方法和查询条件相对注意力(query-conditioned relative attention),并可在 Together…
-
Modal 优化 FlashAttention-4 以实现更快的 LLM 推理速度
Modal 改进了 FlashAttention-4 内核,以提高大型语言模型(LLM)的推理速度,尤其是在解码密集型工作负载方面。他们的贡献侧重于调整并行策略,例如从查询并行转向键/值并行,并使用张量内存加速器(TMA)支持不规则的全局内存访问。该公司发现 CUDA 模板领域特定语言(CuTe DSL)在开发方面非常有效,并预计随着对未来内核开发基于平铺的编程模型的增强支持,将会有进一步的改进。
-
Together AI发布FlashAttention-3和-4,加速大语言模型处理
Together AI发布了FlashAttention-3和FlashAttention-4,这是其用于大语言模型的GPU加速注意力机制的重大升级。FlashAttention-3专为Hopper GPU设计,通过利用张量核心(Tensor Cores)和张量内存加速器(Tensor Memory Accelerator)等新硬件特性并支持FP8精度,实现了高达75%的利用率和比前代产品快1.5-2倍的速度。FlashAttenti…
-
CuTeDSL成为LLM推理的新GPU内核路径,挑战CUTLASS
LLM推理的GPU内核工程领域正在发生转变,CuTeDSL正崭露头角,有望成为C++ CuTe/CUTLASS的后继者。这种演变体现在FlashAttention-4和TorchInductor等技术中的行业趋势。对于2026年的开发者来说,选择C++ CUTLASS还是基于Python的CuTeDSL正成为一个关键考量,PyTorch和NVIDIA在其中扮演着重要角色。