Flashattention
PulseAugur coverage of Flashattention — every cluster mentioning Flashattention across labs, papers, and developer communities, ranked by signal.
10 天有情绪数据
-
明玢FX100存储加速AI推理,助力国产替代
明玢的FX100存储解决方案为AI推理提供了显著的性能提升,特别是在信创环境下的国产替代努力中。通过专注于存储协议和数据路径,而非直接取代GPU,明玢的技术在DeepSeek 70B和32B等大模型上,于AMD MI308X和Ascend 910B等平台上进行测试时,实现了高达40%的吞吐量提升和32%的首个token时间(TTFT)缩减。该方法利用了NVMe-oF和RoCEv2等成熟的开放标准,降低了技术风险,并在AI推理存储方面提…
-
FlashAttention-V 助力向量架构上的 Transformer 推理
研究人员开发了 FlashAttention-V,这是 FlashAttention 为可扩展向量架构量身定制的优化版本。该新方法旨在提高 Transformer 模型(特别是小型语言模型 SLM)在新兴向量硬件上的效率。FlashAttention-V 通过融合操作、利用注意力头之间的并行性以及增强内存局部性,实现了显著的加速,在特定硬件配置上,预填充速度提升高达 42 倍,解码速度提升高达 11 倍。
-
理解 GPU 内核:高效 AI 推理的关键
文章在 GPU 计算 AI 模型的背景下解释了“内核”的概念,将其定义为由数千个线程并行执行的单个函数。文章强调,AI 推理中的主要挑战并非算术计算本身,而是有效地管理 GPU 内存层次结构中的数据移动,特别是有限但快速的“共享内存”。FlashAttention 和 Triton 等技术被提出作为优化数据访问并最大化在需要从较慢的主内存中获取更多数据之前完成的工作的解决方案。
-
计算、内存和存储领域探索LLM首次响应时间缩减策略
减少大型语言模型(LLM)的首次响应时间(TTFT)对于用户体验和性能至关重要。这涉及到优化四个关键领域:计算、GPU内存、存储和整体架构。FlashAttention和PagedAttention等技术解决了计算和内存管理问题,但它们的有效性受到硬件带宽的限制。扩展GPU内存或将KV Cache分层到更快的存储(如NVMe-oF阵列)可以显著减少长上下文场景下的延迟,明信科技的解决方案就证明了这一点,该方案显示480B模型的TTFT…
-
调查量化了注意力机制中的EEI权衡
一篇新发表在arXiv上的调查论文,探讨了注意力机制中效率、表现力和可解释性(EEI)之间的权衡。注意力机制是过去十年机器学习进步的基础。该论文分析了二十一种不同的方法,使用EEI评分框架和蒙特卡洛分析来评估其排名的稳定性。它追溯了注意力机制的演变,从早期的序列到序列模型到现代的视觉架构和Mamba等状态空间替代方案,还探讨了归纳头和叠加等可解释性技术。
-
计算租赁合同需要为AI工作负载添加特定条款
本文重点介绍了计算租赁合同中针对AI工作负载的三个关键但常被忽略的条款:带宽、存储和故障时长。文章强调,网络带宽对于大型模型的推理和训练性能至关重要,直接影响端到端速度。文章还强调了除了容量之外,明确存储性能指标(详细说明读取带宽、IOPS和延迟)的重要性。最后,文章指出,没有明确故障确定、响应时间和赔偿的模糊可用性保证,实际上是没有意义的SLA。
-
新的PRISM-Δ方法增强了大型语言模型中的提示高亮
研究人员开发了PRISM-Δ,一种用于大型语言模型提示高亮的新颖方法。该技术旨在通过提取区分相关上下文与不相关上下文的引导方向来改进模型对特定文本跨度的优先级排序方式。PRISM-Δ分解协方差矩阵以最大化区分性能量,同时最小化共享模式,并且可以应用于键(Key)和值(Value)表示。该方法在各种基准测试和模型上都显示出性能提升,在许多配置中优于现有方法,同时降低了流畅性成本并能有效扩展到长上下文。
-
llama.cpp、PyTorch 和新的 MoE 模型迎来重大更新
llama.cpp 项目发布了更新,增强了 WebGPU 加速功能,并简化了 FlashAttention 的实现,以实现更高效的本地 LLM 推理。同时,PyTorch 的 MPSInductor 现在支持 Apple Metal 代码生成的无符号整数类型,提高了在 Apple Silicon 上的兼容性和性能。此外,一个名为 maple-preview 的新的开源权重混合专家模型正在 Hugging Face 上获得关注,为本地实…
-
推测性解码走向成熟,加速 LLM 推理
推测性解码是一种加速 LLM 推理的技术,已取得显著成熟,相关框架纷纷采用,用户也报告了令人印象深刻的性能提升。尽管核心概念已存在多年,但其在 2026 年的广泛采用和有效性归功于 Tri Dao 等人的“Speculative Speculative Decoding”论文等突破性进展。一些人认为,这项进展对于本地 LLM 推理的重要性堪比之前的 FlashAttention。
-
压缩感知不适用于大语言模型推理存储压缩
由于大语言模型(LLM)推理过程中 KV 缓存数据的非稀疏性以及对确定性、无损操作的需求,压缩感知并非一种适用于压缩 KV 缓存数据的合适方法。相反,推理存储的实际改进来自于优化存储层级和访问路径,这已在 Mingxin FX100 系统中得到证明。这种方法通过将访问频率较低的数据卸载到更快的存储介质,显著降低了延迟和加载时间,同时不影响生成质量。
-
新的BinaryPC方法在无训练情况下提升LLM解码速度
研究人员开发了BinaryPC,一种用于长上下文大语言模型稀疏注意力机制的新型无训练方法。该技术利用二值主成分构建紧凑的二值哈希码和哈希函数,在不进行基于梯度的训练的情况下保留数据结构。实验表明,BinaryPC在保持准确性方面与全注意力机制相当,同时显著优于其他稀疏和基于哈希的方法,在GPU上实现了比FlashAttention高3.56倍的端到端解码吞吐量。
-
明玕FX100存储解决方案加速视频推理,降低延迟
明玕的FX100存储解决方案解决了实时视频推理中的延迟瓶颈,这些瓶颈通常由存储和数据路径限制引起,而非GPU计算能力。该系统采用分层KV缓存方法,将热数据放在GPU HBM中,温数据放在本地NVMe上,冷数据放在NVMe-oF阵列上。该策略显著提高了吞吐量,并减少了长上下文工作负载的首次令牌生成时间(TTFT),吞吐量提升高达40%,TTFT提升32%。
-
BinaryPC 为高效 LLM 解码提供无需训练的稀疏注意力
研究人员开发了 BinaryPC,这是一种新颖的稀疏注意力机制,旨在提高长上下文大型语言模型的效率。这种无需训练的方法使用二值主成分创建紧凑的哈希码,在无需基于梯度的训练的情况下保留结构数据信息。实验表明,BinaryPC 在保持与全注意力相当的准确性的同时,显著优于其他稀疏和基于哈希的方法,在现代 GPU 上与 FlashAttention 相比实现了 3.56 倍的吞吐量提升。
-
DART架构通过融合Transformer和SSM来增强长上下文序列建模
研究人员推出了一种新颖的架构DART(Decoded Attention over Recurrent States),它结合了Transformer和状态空间模型(SSMs)的优势,用于高效的长上下文序列建模。DART基于Mamba-2,通过从SSM的压缩状态解码token条件化的键和值来实现状态-记忆注意力(SMA)。与传统的注意力机制相比,这种方法显著降低了推理缓存需求,并在保持语言建模质量的同时增强了联想回忆和检索能力。
-
新的X-Stage流水线优化提升DiT推理速度
研究人员发现了一个新的流水线阶段,称为X-Stage,可以优化扩散Transformer(DiT)推理过程中的通信-计算重叠。该阶段专注于通信启动后但尚未完全可见的期间,从而更好地预测和管理发送方背压。通过对这个X-Stage进行建模,研究人员重新设计了DeepGEMM MegaMoE和Ulysses序列并行注意力模型的通信-计算融合内核,与现有基线相比实现了显著的加速。
-
开发者按概念深度而非流行度绘制150个AI/ML工具图谱
一位开发者创建了一个约150个AI和机器学习工具的分类图谱,并按“概念深度”而非流行度进行组织。该图谱从即用型AI使用(如ChatGPT)的0级到研究和扩展(包括vLLM和DeepSpeed等工具)的4级不等。列出的每个工具都包含用于理解的文档或文章链接,以及其代码库或主页链接,链接会定期检查有效性。
-
InstantSfM 为深度学习时代提供 GPU 原生运动恢复结构
研究人员开发了 InstantSfM,一个新颖的 GPU 原生运动恢复结构 (SfM) 系统,旨在与深度学习流水线无缝集成。该系统通过将度量深度先验直接嵌入其优化框架,解决了传统以 CPU 为中心的 SfM 方法的局限性,消除了尺度模糊并提高了数值稳定性。InstantSfM 展现了显著的速度提升,在大规模数据集上,其性能比 COLMAP 等成熟工具提高了 40 倍,同时保持了相当的重建精度。
-
新的谱盖方法通过控制权重矩阵几何结构来增强LLM训练
研究人员提出了一种名为“保持各向同性的谱盖”(Isotropy-Preserving Spectral Cap)的新方法,以改进大型语言模型(LLM)的训练。该技术旨在控制训练过程中权重矩阵的内部几何结构,而这在使用Muon等优化器时尚未完全理解。谱盖通过从每次更新中投影出顶部奇异方向的增长来工作,从而在不中断训练的情况下控制输出协方差。在nanoGPT、混合专家路由器(mixture-of-experts routers)和Flas…
-
新方法通过优化注意力机制加速文本到视频生成 · 跟踪4个来源
研究人员开发了新的方法来加速文本到视频生成,目前该过程受到大型Transformer模型中注意力机制的计算需求的瓶颈限制。Apple的CalibAtt和来自arXiv的HeadCast框架提出了无需训练的方法,可以识别并跳过可忽略的token-to-token连接,从而实现显著的加速。FVAttn是另一个无需训练的系统,它通过动态迁移注意力头来解决多GPU设置中的工作负载不平衡问题,在保持视频质量的同时实现了显著的推理加速。
-
Hugging Face 在 Transformers v5.14.0 中发布 Inkling 多模态模型
Hugging Face 发布了其 Transformers 库的 5.14.0 版本,引入了 Inkling 多模态模型。Inkling 由 Thinking Machines 开发,是一个拥有 975B 参数的模型,能够处理文本、图像和音频输入以生成文本输出。此次发布还包括对 TIPSv2 模型的更新、性能增强以及与生成、缓存和内核操作相关的各种错误修复。随后发布了 5.14.1 版本,以解决辅助生成和预填充操作的特定问题。