PulseAugur
实时 14:54:05
实体 Triton

Triton

PulseAugur coverage of Triton — every cluster mentioning Triton across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
21
90 天内 54
发布 · 30天
0
90 天内 0
论文 · 30天
9
90 天内 22
层级分布 · 90 天
主题
关系
情绪 · 30 天

15 天有情绪数据

最近 · 第 1/3 页 · 共 54 条
  1. TOOL · CL_208568 ·

    新的rl-triton库通过统一的GPU内核加速RL信用分配

    研究人员开发了rl-triton,一个开源库,包含用于强化学习信用分配的高性能GPU内核。该库在一个单一的关联扫描框架下统一了七种不同的RL估计算法,包括GAE和V-Trace。内核在Triton中实现,将这些算法作为线性递归在对数并行步中解决,与现有基线相比实现了显著的加速。

  2. COMMENTARY · CL_207842 ·

    理解 GPU 内核:高效 AI 推理的关键

    文章在 GPU 计算 AI 模型的背景下解释了“内核”的概念,将其定义为由数千个线程并行执行的单个函数。文章强调,AI 推理中的主要挑战并非算术计算本身,而是有效地管理 GPU 内存层次结构中的数据移动,特别是有限但快速的“共享内存”。FlashAttention 和 Triton 等技术被提出作为优化数据访问并最大化在需要从较慢的主内存中获取更多数据之前完成的工作的解决方案。

  3. RESEARCH · CL_215745 ·

    新框架优化深度学习和 HPC 的 GPU 内核 · 跟踪 3 个来源

    三篇新的研究论文介绍用于优化 GPU 内核的先进框架,这对于深度学习和高性能计算至关重要。HIERA 专注于跨 PyTorch 和 CUDA 等不同实现空间的感知工作负载规划,展示了更高的效率和性能。AsmEvo 在 AMD GPU 的汇编级别进行优化,验证功能等价性并在生产工作负载上实现显著加速。KernelArc 在 NVIDIA GPU 上采用多智能体框架进行自主优化,通过协调专业智能体在基准排行榜上获得顶尖排名。

  4. TOOL · CL_204366 ·

    华为开源昇腾NPU IR,增强毕昇编译器灵活性

    华为已开源其毕昇编译器核心组件昇腾NPU IR。这个基于MLIR的抽象层专为昇腾硬件设计,支持Triton等前端语言,并扩展了对新款Ascend 950处理器的兼容性。此举旨在增强编译器的灵活性及其在各种硬件和编程范式中的广泛应用。

  5. RESEARCH · CL_198092 ·

    新的基准测试评估LLM在真实Triton内核生成方面的能力

    研究人员推出了RealisticTritonBench,这是一个旨在评估大型语言模型(LLM)为AI框架生成Triton内核能力的新基准测试。与之前的基准测试不同,RealisticTritonBench的任务来源于流行的开源AI框架中的真实拉取请求(pull requests),提供了对内核生成更现实的评估。该基准测试将生成的内核集成到其原始框架中,并使用端到端测试对其进行评估,解决了先前工作仅关注单个内核性能和手动评估脚本的局限性…

  6. SIGNIFICANT · CL_195511 ·

    OpenAI 通过 AI 驱动的优化将 GPT-5.6 价格下调高达 80%

    OpenAI 已显著降低了其 GPT-5.6 模型系列的价格,其中 Luna 套餐现已便宜 80%,Terra 套餐便宜 20%。此次成本降低主要得益于工程优化,包括 GPT-5.6 Sol 模型自主重写其推理内核以提高效率。预计这些服务成本的提高将使更多 AI 应用,如大批量分类和代理任务,在规模上具有经济可行性。

  7. TOOL · CL_194005 ·

    在不规则GPU工作负载上,Rust和CUDA C++的表现优于Triton

    一篇新的研究论文比较了CUDA C++、Rust和Triton在GPU工作负载上的性能,特别关注哈希表插入等不规则操作。研究发现,虽然这三种语言在规则、密集线性代数任务上的表现相似,但在不规则工作负载上,Rust和CUDA C++的表现显著优于Triton。Triton在表达探测循环和原子操作方面的局限性会导致性能大幅下降,甚至在某些情况下导致数据丢失。

  8. TOOL · CL_193662 ·

    Attn-QAT 实现了 LLM 稳定的4位注意力训练

    研究人员开发了 Attn-QAT,一种用于大型语言模型注意力机制的4位量化感知训练的新颖方法。该方法解决了 FP4 计算中低精度带来的挑战,特别是对于对动态范围限制敏感的注意力分数。Attn-QAT 通过匹配反向传播中的低精度重计算并解决梯度计算中隐含的精度假设,提高了训练稳定性,在没有显式异常值缓解的情况下达到了与更高精度相当的质量。

  9. TOOL · CL_193388 ·

    新的线性化注意力模型实现了更高的准确率和更低的困惑度

    研究人员开发了一种 2-单纯复形注意力的线性化版本,将三线性分数重写为内积。这种新形式允许在序列长度上实现线性成本,同时保持全局覆盖范围,这与传统的窗口注意力机制不同。通过使用正随机特征近似求和并将过去的信息存储在固定大小的状态中,该方法可以使用自定义 Triton 内核实现,并与 Kimi Delta Attention 集成。最终的模型完全省略了 softmax 注意力,在 LAMBADA 等基准测试中展示了优越的下游准确率和更高的困惑度。

  10. TOOL · CL_191323 ·

    新方法将线性注意力改造到扩散语言模型中以加速其运行

    研究人员开发了一种将线性注意力改造到扩散语言模型(dLLMs)中的方法,以加速推理。这种名为块混合注意力(block-hybrid attention)的新方法将精确的softmax注意力与活动去噪块结合,并对之前的块应用线性注意力。当应用于LLaDA~2.1模型并生成LLaDA-Hybrid时,它实现了高达1.7倍的解码吞吐量提升,并提高了内存效率,同时在HumanEval和MBPP+等基准测试中性能没有明显下降。

  11. TOOL · CL_189832 ·

    开源 Triton 驱动程序可在 QEMU 虚拟机上运行 DirectX 11

    一个名为 Triton 的新开源驱动程序已被开发出来,它允许 DirectX 11 在 QEMU 虚拟机中运行。这一进展是人工智能日益融入开发过程的更广泛趋势的一部分,人们期望人工智能也将用于消费文档和协助设置任务。

  12. TOOL · CL_189597 ·

    Triton驱动程序为QEMU模拟器带来DirectX 11支持

    一款名为Triton的新驱动程序已被开发出来,为通用的模拟器和虚拟化软件QEMU带来DirectX 11兼容性。该驱动程序旨在实现跨macOS、iOS、Microsoft Windows和Linux等各种操作系统的更广泛图形支持。Triton旨在通过MoltenVK在Apple平台上将DirectX 11调用转换为Vulkan,一个现代图形API。

  13. TOOL · CL_187928 ·

    Triton解释器bug已修复:argmin/argmax中的NaN处理已纠正

    Triton解释器模式中的一个bug导致`tl.argmin`和`tl.argmax`函数在处理NaN值时的行为出现差异。与编译模式不同,解释器由于缺少条件逻辑分支,错误地允许NaN被视为最小值或最大值。此问题在PR #10699中被识别并解决,通过添加必要的路由逻辑和回归测试,确保解释器准确反映编译行为。

  14. SIGNIFICANT · CL_187111 ·

    Moonshot AI 的 Kimi K3 生成 macOS 桌面,设计芯片

    Moonshot AI 发布了 Kimi K3,这是一个拥有 2.8 万亿参数的开源模型,具有一百万 token 的上下文窗口。该模型能够执行复杂的、长周期的任务,包括在浏览器中自主生成功能齐全的 macOS 桌面,以及在 48 小时内设计出一款 45nm 芯片。虽然 Kimi K3 在所有基准测试中可能无法超越 Claude Fable 5 或 GPT 5.6 Sol 等顶级模型,但其开源性质和先进功能(如“Vision in th…

  15. TOOL · CL_182911 ·

    韦伯望远镜揭示海王星卫星灾难性过往迹象

    詹姆斯·韦伯太空望远镜(James Webb Space Telescope)为海王星卫星的历史提供了新见解,暗示了过去曾发生过灾难性事件。观测表明,海王星的几颗卫星可能因一次大规模碰撞而发生显著改变,甚至可能是在碰撞中形成的。

  16. RESEARCH · CL_183101 ·

    AI 系统优化科学计算的 GPU 内核性能

    研究人员开发了两个新颖的系统 SparseDitto 和 KernelBrain,旨在优化各种计算任务的 GPU 内核性能。SparseDitto 利用基于 LLM 的代理生成稀疏矩阵运算的自定义 GPU 内核,在 NVIDIA 硬件上实现了比 cuSPARSE 等现有库显著的加速。KernelBrain 采用粗粒度到细粒度、预算感知的搜索策略来优化 GPU 内核,与 PyTorch 和其他最先进的内核代理相比,提高了质量和效率。

  17. TOOL · CL_174543 ·

    AMD V620 GPU 成功集成到 ComfyUI 中用于 AI 任务

    一位用户成功地将 AMD V620 工作站显卡集成到其 ComfyUI 设置中用于 Stable Diffusion,尽管最初对其性能有所怀疑。虽然速度不快,但该显卡因其 32GB VRAM 而被购买,可可靠地用于生成图像和视频,并且还可用于本地大型语言模型 (LLM) 任务。用户已记录了基准测试并确认了与 Triton 和 Sage Attention 的兼容性,将 GPU 识别为 gfx1030 并使用 ROCm。

  18. SIGNIFICANT · CL_172359 ·

    OpenAI 的 GPT-5.6 在生产环境中主动优化自身系统

    OpenAI 已披露其 GPT-5.6 模型正在生产环境中使用,以优化自身系统,这一过程被描述为递归自我改进(RSI)。该模型分析流量、重新路由请求,甚至重写底层代码,从而将服务成本降低了 20%,并将 token 生成效率提高了 15%。虽然 GPT-5.6 尚未完全训练下一代人工智能,但它正在积极参与修改其运行环境,充当自身系统的工程师。这一进展得到了人类主导的在代理工具链中的优化的补充,以减少重复任务并改进提示缓存,进一步提高效率。

  19. RESEARCH · CL_167228 ·

    LLM生成的硬件内核出现新的基准测试和优化工具

    两篇新的研究论文介绍了用于大型语言模型(LLM)生成硬件加速器代码的基准测试和优化框架。第一篇论文KernelGenBench提供了一个统一的基准测试,用于评估LLM生成的Triton内核在不同算子源和硬件平台上的性能,揭示了基于代理的方法存在显著的性能差异和高令牌成本。第二篇论文提出了一个基于编译器的分层诊断系统,用于优化Ascend NPU等新兴加速器上的Triton内核,通过将运行时问题与编译器行为联系起来,实现了显著的加速。

  20. TOOL · CL_166173 ·

    TRELLIS.2 INT8 ConvRot 模型通过 ComfyUI 在 AMD RX 7900 XTX 上原生运行

    一位开发者发布了一个补丁套件,使 TRELLIS.2 INT8 ConvRot 模型能够通过 ComfyUI 在 AMD RX 7900 XTX GPU 上原生运行。该实现利用了融合的 Triton 内核以提高性能,与之前的方法相比,在某些操作中速度提高了 3.08 倍。该版本包含一个现成的 1024 工作流,并支持各种检查点路由选项,尽管纹理导出仍在开发中。