PulseAugur
实时 09:26:38
实体 FlashAttention-4

FlashAttention-4

PulseAugur coverage of FlashAttention-4 — every cluster mentioning FlashAttention-4 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 7
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 3
层级分布 · 90 天
主题
时间线
  1. 2026-05-22 product_launch Together AI released FlashAttention-4, an optimized algorithm for Blackwell GPUs. 来源
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 7 条
  1. RESEARCH · CL_183287 ·

    新的大语言模型研究致力于加速训练、领域适应和推理效率

    多篇在 arXiv 上发表的研究论文探索了优化大语言模型(LLM)训练和推理的新方法。A-3PO 提出了一种近似策略优化方法,以加速 LLM 训练;Diffract 通过检查权重矩阵和注意力头来分析领域适应;ZeroLock 引入了一种无反向传播算法,用于内存高效的 LLM 训练;DistillCache 使用强化学习进行推理过程中的自适应 KV 缓存驱逐。其他研究则侧重于通过采样多样性提高 LLM 推理性能,防范针对 KV 缓存的侧…

  2. TOOL · CL_167355 ·

    新的X-Stage流水线优化提升DiT推理速度

    研究人员发现了一个新的流水线阶段,称为X-Stage,可以优化扩散Transformer(DiT)推理过程中的通信-计算重叠。该阶段专注于通信启动后但尚未完全可见的期间,从而更好地预测和管理发送方背压。通过对这个X-Stage进行建模,研究人员重新设计了DeepGEMM MegaMoE和Ulysses序列并行注意力模型的通信-计算融合内核,与现有基线相比实现了显著的加速。

  3. FRONTIER RELEASE · CL_147228 ·

    Together AI 发布 Inkling 多模态 MoE 模型,拥有 100 万上下文窗口

    Together AI 推出了 Inkling,这是由 Thinking Machines Lab 开发的多模态混合专家(MoE)模型。该开放权重模型拥有 9750 亿总参数和 410 亿激活参数,100 万 token 的上下文窗口,并原生支持文本、图像和音频输入。Inkling 通过 Together 的 FlashAttention-4 内核进行了优化,以实现高效推理,现在可通过 Together Serverless Infe…

  4. SIGNIFICANT · CL_145122 ·

    Thinking Machines Lab 发布 Inkling 多模态模型,支持可控推理

    Thinking Machines Lab 推出了 Inkling,这是一款专为高效推理和多功能任务处理而设计的新型多模态模型。该模型接受文本、图像和音频输入,并具有可控的推理能力,以平衡推理深度与延迟和 token 使用量。Inkling 包含多项架构创新,包括混合专家(mixture-of-experts)方法和查询条件相对注意力(query-conditioned relative attention),并可在 Together…

  5. TOOL · CL_86322 ·

    Modal 优化 FlashAttention-4 以实现更快的 LLM 推理速度

    Modal 改进了 FlashAttention-4 内核,以提高大型语言模型(LLM)的推理速度,尤其是在解码密集型工作负载方面。他们的贡献侧重于调整并行策略,例如从查询并行转向键/值并行,并使用张量内存加速器(TMA)支持不规则的全局内存访问。该公司发现 CUDA 模板领域特定语言(CuTe DSL)在开发方面非常有效,并预计随着对未来内核开发基于平铺的编程模型的增强支持,将会有进一步的改进。

  6. RESEARCH · CL_44358 ·

    Together AI发布FlashAttention-3和-4,加速大语言模型处理

    Together AI发布了FlashAttention-3和FlashAttention-4,这是其用于大语言模型的GPU加速注意力机制的重大升级。FlashAttention-3专为Hopper GPU设计,通过利用张量核心(Tensor Cores)和张量内存加速器(Tensor Memory Accelerator)等新硬件特性并支持FP8精度,实现了高达75%的利用率和比前代产品快1.5-2倍的速度。FlashAttenti…

  7. RESEARCH · CL_13517 ·

    CuTeDSL成为LLM推理的新GPU内核路径,挑战CUTLASS

    LLM推理的GPU内核工程领域正在发生转变,CuTeDSL正崭露头角,有望成为C++ CuTe/CUTLASS的后继者。这种演变体现在FlashAttention-4和TorchInductor等技术中的行业趋势。对于2026年的开发者来说,选择C++ CUTLASS还是基于Python的CuTeDSL正成为一个关键考量,PyTorch和NVIDIA在其中扮演着重要角色。