PulseAugur
中
实时 13:26:21
实体 Flashattention

Flashattention

PulseAugur coverage of Flashattention — every cluster mentioning Flashattention across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
56
90 天内 56
发布 · 30天
0
90 天内 0
论文 · 30天
37
90 天内 37
层级分布 · 90 天
主题
关系
情绪 · 30 天

7 天有情绪数据

最近 · 第 1/4 页 · 共 65 条
  1. TOOL · CL_284569 ·

    TabiBERT:发布新的土耳其语基础模型和基准

    研究人员推出了 TabiBERT,一个基于 ModernBERT 架构的新型大规模土耳其语基础模型。该模型在超过一万亿个 token 的海量数据集上进行了训练,涵盖了网络文本、科学出版物和源代码,并支持 8,192 个 token 的上下文长度。为了评估 TabiBERT,开发了一个名为 TabiBench 的新基准,该基准包含八个任务类别中的 27 个数据集。与之前的土耳其语模型相比,TabiBERT 在问答和代码检索任务上表现出了卓越的性能。

  2. TOOL · CL_284406 ·

    Cleave编译器优化大型模型的张量程序

    研究人员开发了Cleave,这是一种新的机器学习编译器,旨在优化大型模型的张量程序。Cleave采用符号解耦策略,首先在具有符号形状的图上执行超优化,然后在具体形状上调度转换后的图。这种方法可以有效地处理具有多个归约的计算,并已显示出显著的速度提升,生成的内核比现有基线快2.8倍。

  3. TOOL · CL_279805 ·

    llama.cpp 项目发布预发布更新,包含性能优化

    llama.cpp 项目发布了多个预发布更新,包括对 MoE expert 的 GPU 缓存管理改进、针对 Apple Silicon 的各种量化类型的优化,以及对 Metal fusion 操作的修复。这些更新还解决了 temperature-zero chains 的采样逻辑,并引入了新的词汇 token。这些发布涵盖了 macOS、iOS、Linux、Android 和 Windows 等广泛平台,并针对 Apple Silic…

  4. TOOL · CL_275299 ·

    新的LampAttention技术为专用硬件优化AI模型精度

    研究人员开发了LampAttention,一种专为专用硬件加速器设计的新型混合精度FlashAttention技术。该方法以较低精度计算大部分注意力logits,并自适应地以较高精度重新计算敏感子块,以保持数值稳定性和模型性能。使用Qwen3和Gemma 3模型进行的模拟表明,通过选择性地将一小部分计算重新路由到较高精度,该方法可以恢复基线性能。

  5. TOOL · CL_281702 ·

    MinkowskiPE 将时空平移不变性引入 AI 注意力机制

    研究人员推出了一种新颖的时空耦合建模方法——Minkowski 相对位置编码 (MinkowskiPE)。该方法利用联合时空坐标来参数化注意力机制中的洛伦兹变换,使注意力分数仅依赖于相对时空位移。MinkowskiPE 旨在将数据驱动学习的灵活性与明确的几何先验相结合,并在分子动力学和视频预测任务中取得了初步成果。

  6. COMMENTARY · CL_253275 ·

    FlashAttention效率与H-1B签证费对科技工作的影响

    第一项讨论了FlashAttention,这是斯坦福大学Tri Dao开发的一种技术,它优化了Transformer模型中的注意力机制。该方法使用PyTorch和CUDA实现,旨在通过减少内存使用和提高速度来提高大型语言模型的效率,尤其是在图形处理单元方面。第二项报道了美国政府新推出的10万美元H-1B签证费,据称这正在将科技工作推向海外。这一政策变化可能会影响科技人才的分布,并可能导致公司选择招聘地点的转变。

  7. RESEARCH · CL_247852 ·

    新方法提升LLM稀疏注意力效率

    研究人员开发了两种新颖的方法来提高大型语言模型中稀疏注意力机制的效率。第一种,HISA(分层索引稀疏注意力),引入了一个两阶段的索引过程,首先过滤令牌块,然后在这些块内进行精炼选择,在无需重新训练的情况下实现显著的加速。第二种,SAS(简单注意力稀疏化),使用一个端到端与语言建模损失一起训练的连续门控机制来优化上下文排名,其性能优于现有的可训练稀疏注意力方法,尤其是在注意力预算紧张的情况下。

  8. TOOL · CL_249698 ·

    新的EFQ-Softmax方法优化Transformer的低比特量化

    研究人员开发了EFQ-Softmax,一种用于Transformer模型低比特量化的新颖方法,它绕过了Softmax的传统指数计算。该方法直接将移位的注意力分数映射到E2M1操作数,在不牺牲模型质量的情况下优化效率。在Qwen3-8B和Qwen3-VL-8B-Instruct等模型上的评估显示性能指标有所提高,并且在A5向量单元上的内核级测试证明延迟显著降低。

  9. TOOL · CL_239458 ·

    FlashAttention 加速核方法中的高斯核和

    研究人员开发了一种利用 FlashAttention 计算高斯核和的方法,这是各种核方法中的关键组成部分。这种新颖的方法将归一化 softmax 归约转化为非归一化高斯和,只需最小的输入增强,无需自定义 GPU 代码。与现有的 PyTorch 和 PyKeOps 实现相比,该技术在速度、内存效率和准确性方面表现更优,尤其是在 fp16 中处理更高特征维度时。

  10. TOOL · CL_212517 ·

    明玢FX100存储加速AI推理,助力国产替代

    明玢的FX100存储解决方案为AI推理提供了显著的性能提升,特别是在信创环境下的国产替代努力中。通过专注于存储协议和数据路径,而非直接取代GPU,明玢的技术在DeepSeek 70B和32B等大模型上,于AMD MI308X和Ascend 910B等平台上进行测试时,实现了高达40%的吞吐量提升和32%的首个token时间(TTFT)缩减。该方法利用了NVMe-oF和RoCEv2等成熟的开放标准,降低了技术风险,并在AI推理存储方面提…

  11. TOOL · CL_210536 ·

    FlashAttention-V 助力向量架构上的 Transformer 推理

    研究人员开发了 FlashAttention-V,这是 FlashAttention 为可扩展向量架构量身定制的优化版本。该新方法旨在提高 Transformer 模型(特别是小型语言模型 SLM)在新兴向量硬件上的效率。FlashAttention-V 通过融合操作、利用注意力头之间的并行性以及增强内存局部性,实现了显著的加速,在特定硬件配置上,预填充速度提升高达 42 倍,解码速度提升高达 11 倍。

  12. COMMENTARY · CL_207842 ·

    理解 GPU 内核:高效 AI 推理的关键

    文章在 GPU 计算 AI 模型的背景下解释了“内核”的概念,将其定义为由数千个线程并行执行的单个函数。文章强调,AI 推理中的主要挑战并非算术计算本身,而是有效地管理 GPU 内存层次结构中的数据移动,特别是有限但快速的“共享内存”。FlashAttention 和 Triton 等技术被提出作为优化数据访问并最大化在需要从较慢的主内存中获取更多数据之前完成的工作的解决方案。

  13. TOOL · CL_206773 ·

    计算、内存和存储领域探索LLM首次响应时间缩减策略

    减少大型语言模型(LLM)的首次响应时间(TTFT)对于用户体验和性能至关重要。这涉及到优化四个关键领域:计算、GPU内存、存储和整体架构。FlashAttention和PagedAttention等技术解决了计算和内存管理问题,但它们的有效性受到硬件带宽的限制。扩展GPU内存或将KV Cache分层到更快的存储(如NVMe-oF阵列)可以显著减少长上下文场景下的延迟,明信科技的解决方案就证明了这一点,该方案显示480B模型的TTFT…

  14. TOOL · CL_206109 ·

    调查量化了注意力机制中的EEI权衡

    一篇新发表在arXiv上的调查论文,探讨了注意力机制中效率、表现力和可解释性(EEI)之间的权衡。注意力机制是过去十年机器学习进步的基础。该论文分析了二十一种不同的方法,使用EEI评分框架和蒙特卡洛分析来评估其排名的稳定性。它追溯了注意力机制的演变,从早期的序列到序列模型到现代的视觉架构和Mamba等状态空间替代方案,还探讨了归纳头和叠加等可解释性技术。

  15. COMMENTARY · CL_194250 ·

    计算租赁合同需要为AI工作负载添加特定条款

    本文重点介绍了计算租赁合同中针对AI工作负载的三个关键但常被忽略的条款:带宽、存储和故障时长。文章强调,网络带宽对于大型模型的推理和训练性能至关重要,直接影响端到端速度。文章还强调了除了容量之外,明确存储性能指标(详细说明读取带宽、IOPS和延迟)的重要性。最后,文章指出,没有明确故障确定、响应时间和赔偿的模糊可用性保证,实际上是没有意义的SLA。

  16. TOOL · CL_193759 ·

    新的PRISM-Δ方法增强了大型语言模型中的提示高亮

    研究人员开发了PRISM-Δ,一种用于大型语言模型提示高亮的新颖方法。该技术旨在通过提取区分相关上下文与不相关上下文的引导方向来改进模型对特定文本跨度的优先级排序方式。PRISM-Δ分解协方差矩阵以最大化区分性能量,同时最小化共享模式,并且可以应用于键(Key)和值(Value)表示。该方法在各种基准测试和模型上都显示出性能提升,在许多配置中优于现有方法,同时降低了流畅性成本并能有效扩展到长上下文。

  17. TOOL · CL_191687 ·

    llama.cpp、PyTorch 和新的 MoE 模型迎来重大更新

    llama.cpp 项目发布了更新,增强了 WebGPU 加速功能,并简化了 FlashAttention 的实现,以实现更高效的本地 LLM 推理。同时,PyTorch 的 MPSInductor 现在支持 Apple Metal 代码生成的无符号整数类型,提高了在 Apple Silicon 上的兼容性和性能。此外,一个名为 maple-preview 的新的开源权重混合专家模型正在 Hugging Face 上获得关注,为本地实…

  18. TOOL · CL_192302 ·

    推测性解码走向成熟,加速 LLM 推理

    推测性解码是一种加速 LLM 推理的技术,已取得显著成熟,相关框架纷纷采用,用户也报告了令人印象深刻的性能提升。尽管核心概念已存在多年,但其在 2026 年的广泛采用和有效性归功于 Tri Dao 等人的“Speculative Speculative Decoding”论文等突破性进展。一些人认为,这项进展对于本地 LLM 推理的重要性堪比之前的 FlashAttention。

  19. TOOL · CL_187642 ·

    压缩感知不适用于大语言模型推理存储压缩

    由于大语言模型(LLM)推理过程中 KV 缓存数据的非稀疏性以及对确定性、无损操作的需求,压缩感知并非一种适用于压缩 KV 缓存数据的合适方法。相反,推理存储的实际改进来自于优化存储层级和访问路径,这已在 Mingxin FX100 系统中得到证明。这种方法通过将访问频率较低的数据卸载到更快的存储介质,显著降低了延迟和加载时间,同时不影响生成质量。

  20. TOOL · CL_185266 ·

    新的BinaryPC方法在无训练情况下提升LLM解码速度

    研究人员开发了BinaryPC,一种用于长上下文大语言模型稀疏注意力机制的新型无训练方法。该技术利用二值主成分构建紧凑的二值哈希码和哈希函数,在不进行基于梯度的训练的情况下保留数据结构。实验表明,BinaryPC在保持准确性方面与全注意力机制相当,同时显著优于其他稀疏和基于哈希的方法,在GPU上实现了比FlashAttention高3.56倍的端到端解码吞吐量。