Triton
PulseAugur coverage of Triton — every cluster mentioning Triton across labs, papers, and developer communities, ranked by signal.
6 天有情绪数据
-
新的PHBA架构提高了AI长上下文建模的效率
研究人员推出了一种名为前缀状态混合块注意力(PHBA)的新型架构,旨在增强AI中的长上下文建模。PHBA集成了压缩的历史状态和块稀疏检索,使模型能够在单个层内访问精确的长距离证据和摘要上下文。这种方法旨在提高需要广泛上下文回忆的任务的性能,同时保持高效的训练和推理,其表现优于现有的线性和混合注意力方法。
-
133 GB MoE 模型通过 NVMe 流式传输在 8 GB GPU 上运行
一篇技术博文详细介绍了一种在消费级 8 GB GPU 上运行大型 133 GB 混合专家(MoE)模型 Qwen3.8 Flash-Next 的方法。该技术涉及从 NVMe 存储流式传输模型专家,并利用自定义的 PyTorch 和 Triton 引擎来高效管理数据加载和计算。这种方法实现了每秒 11 个 token 的速度,与模型在参考实现上的性能相当,并且是与 Claude 和 Codex 等模型的 AI 辅助协作开发的。
-
新的MWOP技术通过定向剪枝提升MLLM效率
研究人员开发了一种名为“模态感知宽度操作剪枝”(MWOP)的新方法,以提高多模态大语言模型(MLLM)的效率。MWOP通过独立剪枝视觉到视觉、文本到视觉和文本到文本的注意力路径,并分别选择视觉和文本输入的FFN通道,来解决注意力头和前馈网络(FFN)通道内的冗余问题。这种方法在保留令牌序列的同时减少了计算量,从而显著加快了速度。在LLaVA-OneVision-7B上,MWOP单独实现了1.6倍的预填充速度提升,且性能损失极小;与令牌…
-
新的注意力量化加速表格基础模型
研究人员为表格基础模型开发了一种新的注意力量化策略,以提高推理性能。该方法侧重于将查询、键和值量化为 FP8,并利用显式的 FP8 矩阵乘法指令。一项关键发现是,必须在训练和测试数据之间对齐量化误差,以防止精度下降。开发的 Triton 内核在标准 16 位内核上实现了高达 1.7 倍的加速,同时在 TabPFN-v3 和 TabICLv2 等模型在基准数据集上的表现没有显著的精度损失。
-
新工具和研究致力于 GPU AI 工作负载的优化
多篇研究论文和一个新的开源工具解决了在 GPU 上优化 AI 工作负载的挑战。COMPASS-ABS 旨在减少深度学习训练共享 GPU 集群中的碎片化,提高资源利用率和作业完成时间。研究人员还开发了自适应框架,如用于商品 GPU 上高效长上下文推理的 Tri-Metric Router 和使用数据流不变性进行代理 GPU 优化的 Ave。此外,mKernel 和 AttnFuse 分别专注于为多 GPU 系统和注意力机制创建快速、融合…
-
AI与HPC通过Triton和SYCL的Stencil计算实现融合
本文通过Stencil计算的视角探讨了AI与高性能计算(HPC)的交叉领域。文章重点介绍了向量外积等技术以及Triton编程模型如何应用于优化这些计算,而这些计算对于许多科学模拟和AI工作负载至关重要。文章还提到了SYCL标准,作为在该领域实现跨不同硬件架构可移植性的一种方式。
-
Einsummable 包实现了 AI 的自动多 GPU 并行
一个名为 Einsummable 的新软件包已被开发出来,用于在多个 GPU 上自动并行化 AI 计算。这种方法利用 CUDA 和 Triton 为大型语言模型和其他 AI 任务实现高效的多 GPU 执行。目标是简化在可用硬件上分发计算工作负载的过程。
-
新AI代理AdaExplore提升内核代码生成效率
研究人员开发了AdaExplore,一个旨在提高高效内核代码生成能力的创新代理框架,特别适用于Triton等领域特定语言。该系统采用两阶段流程:面向失败的自适应,它从反复出现的错误中构建有效性规则的记忆;以及保持多样性的搜索,它通过在局部改进和结构化再生之间交替来探索优化空间。在KernelBench基准测试上的实验表明,AdaExplore在100步内分别在Level-2和Level-3基准测试上实现了3.11倍和1.62倍的显著加速。
-
BEAM3R 使用 Mamba-3 加速辐射剂量重建
研究人员开发了 BEAM3R,一个用于放射治疗中准确快速剂量计算的新颖框架。该系统利用 Mamba-3 状态空间模型,摒弃了昂贵的 3D 卷积,采用了更高效的深度序列核心。BEAM3R 处理 2D 视线视图切片,并结合基于物理的传输条件来模拟剂量分布,在 DoseRAD2026 挑战赛上实现了高伽马通过率。该框架还包括从 MRI 数据生成合成 CT 图像的方法,尽管这会略微降低准确性。
-
新电子书指导机器学习从业者使用 Triton 优化 GPU 性能
Manning Publications 发布了由 Harshwardhan Fartale 撰写的抢先体验版电子书《GPU Programming with Triton》。本书旨在通过使用 Triton 语言在 Python 中编写自定义 GPU 内核来帮助机器学习从业者优化他们的模型。内容涵盖识别性能瓶颈、构建和基准测试内核、优化内存流量以及通过平铺和向量化等技术提高性能。
-
LoGo 引入动态注意力,实现高效长上下文 LLM
研究人员推出 LoGo,一种新颖的令牌级动态局部-全局注意力机制,旨在提高大型语言模型的效率。LoGo 通过允许所有令牌访问局部注意力,同时为需要长距离信息的令牌选择性地激活全局注意力,来动态分配注意力预算。这种方法旨在保持全注意力 Transformer 的扩展行为,同时在涉及长距离检索的任务中,与静态局部-全局混合模型和全注意力模型相比,提供显著的改进。
-
新基准测试LLM在GPU数据库查询优化方面的能力
研究人员开发了DataKernelBench,这是一个旨在评估大型语言模型(LLM)针对GPU优化数据库查询能力的新基准。与专注于机器学习算子的现有基准不同,DataKernelBench解决了数据密集型数据库操作的独特挑战。该基准将SQL查询转换为PyTorch TorchPlan程序,使LLM能够使用CUDA或Triton优化特定的代码片段或整个查询。使用NVIDIA H100 GPU在TPC-H数据集上进行的初步测试表明,LLM…
-
新的rl-triton库通过统一的GPU内核加速RL信用分配
研究人员开发了rl-triton,一个开源库,包含用于强化学习信用分配的高性能GPU内核。该库在一个单一的关联扫描框架下统一了七种不同的RL估计算法,包括GAE和V-Trace。内核在Triton中实现,将这些算法作为线性递归在对数并行步中解决,与现有基线相比实现了显著的加速。
-
理解 GPU 内核:高效 AI 推理的关键
文章在 GPU 计算 AI 模型的背景下解释了“内核”的概念,将其定义为由数千个线程并行执行的单个函数。文章强调,AI 推理中的主要挑战并非算术计算本身,而是有效地管理 GPU 内存层次结构中的数据移动,特别是有限但快速的“共享内存”。FlashAttention 和 Triton 等技术被提出作为优化数据访问并最大化在需要从较慢的主内存中获取更多数据之前完成的工作的解决方案。
-
新框架优化深度学习和 HPC 的 GPU 内核 · 跟踪 3 个来源
三篇新研究论文介绍了用于优化 GPU 内核的先进框架,这对于深度学习和高性能计算至关重要。HIERA 专注于跨 PyTorch 和 CUDA 等不同实现空间的感知工作负载规划,展示了更高的效率和性能。AsmEvo 在 AMD GPU 的汇编级别进行优化,验证功能等价性并在生产工作负载上实现显著加速。KernelArc 在 NVIDIA GPU 上采用多智能体框架进行自主优化,通过协调专业智能体在基准排行榜上获得顶级排名。
-
华为开源昇腾NPU IR,增强毕昇编译器灵活性
华为已开源其毕昇编译器核心组件昇腾NPU IR。这个基于MLIR的抽象层专为昇腾硬件设计,支持Triton等前端语言,并扩展了对新款Ascend 950处理器的兼容性。此举旨在增强编译器的灵活性及其在各种硬件和编程范式中的广泛应用。
-
新的基准测试评估LLM在真实Triton内核生成方面的能力
研究人员推出了RealisticTritonBench,这是一个旨在评估大型语言模型(LLM)为AI框架生成Triton内核能力的新基准测试。与之前的基准测试不同,RealisticTritonBench的任务来源于流行的开源AI框架中的真实拉取请求(pull requests),提供了对内核生成更现实的评估。该基准测试将生成的内核集成到其原始框架中,并使用端到端测试对其进行评估,解决了先前工作仅关注单个内核性能和手动评估脚本的局限性…
-
OpenAI 通过 AI 驱动的优化将 GPT-5.6 价格下调高达 80%
OpenAI 已显著降低了其 GPT-5.6 模型系列的价格,其中 Luna 套餐现已便宜 80%,Terra 套餐便宜 20%。此次成本降低主要得益于工程优化,包括 GPT-5.6 Sol 模型自主重写其推理内核以提高效率。预计这些服务成本的提高将使更多 AI 应用,如大批量分类和代理任务,在规模上具有经济可行性。
-
在不规则GPU工作负载上,Rust和CUDA C++的表现优于Triton
一篇新的研究论文比较了CUDA C++、Rust和Triton在GPU工作负载上的性能,特别关注哈希表插入等不规则操作。研究发现,虽然这三种语言在规则、密集线性代数任务上的表现相似,但在不规则工作负载上,Rust和CUDA C++的表现显著优于Triton。Triton在表达探测循环和原子操作方面的局限性会导致性能大幅下降,甚至在某些情况下导致数据丢失。
-
Attn-QAT 实现了 LLM 稳定的4位注意力训练
研究人员开发了 Attn-QAT,一种用于大型语言模型注意力机制的4位量化感知训练的新颖方法。该方法解决了 FP4 计算中低精度带来的挑战,特别是对于对动态范围限制敏感的注意力分数。Attn-QAT 通过匹配反向传播中的低精度重计算并解决梯度计算中隐含的精度假设,提高了训练稳定性,在没有显式异常值缓解的情况下达到了与更高精度相当的质量。