PulseAugur
实时 11:59:21
实体 CUDA Agent

CUDA Agent

PulseAugur coverage of CUDA Agent — every cluster mentioning CUDA Agent across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
时间线
  1. 2026-08-18 research_milestone ByteDance Seed and Tsinghua AIR introduced CUDA Agent, a system that trains LLMs to generate high-performance GPU kernels. 来源
  2. 2026-08-18 research_milestone ByteDance Seed and Tsinghua AIR introduced CUDA Agent, an AI system that trains language models to generate optimized GPU kernels, significantly outperforming compiler-generated code. 来源
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. RESEARCH · CL_205512 ·

    ByteDance 和 清华AIR 训练大语言模型使用 CUDA Agent 编写更快的 GPU 代码

    ByteDance Seed 和 清华AIR 开发了 CUDA Agent,一个使用强化学习训练大语言模型生成优化 GPU 核的系统。该系统在 KernelBench 基准测试中达到了 98.8% 的正确率,并且生成的核比编译器生成的代码快 96.8% 的时间。该 Agent 在模拟的 CUDA 开发环境中运行,结合了性能分析和正确性检查来提高核性能,在 AI 基础设施和其他延迟敏感领域具有潜在应用。

  2. RESEARCH · CL_160756 ·

    新的 CudaPerf 框架通过结构化奖励增强 CUDA 核生成

    研究人员开发了 CudaPerf,这是一个旨在改进 CUDA 核生成的新强化学习框架。该框架超越了传统的速度和正确性指标,通过整合代码的结构属性,如内存合并和同步模式。CudaPerf 分两个阶段进行:离线成对排序和在线强化学习训练,并进行迭代优化,利用统一的奖励信号。评估表明,CudaPerf 通过在 C 到 CUDA 和 PyTorch 到 CUDA 转换的速度提升和正确性方面取得显著改进,其性能显著优于包括 Qwen 3 32B…

  3. RESEARCH · CL_70092 ·

    本地AI模型在消费级GPU上运行,降低成本

    本地AI的新进展使得大型语言模型可以在个人硬件上访问。像OpenAI的GPT-OSS-120B和Google的Gemma 4 12B这样的模型现在可以在RTX 5090和AMD RX 7800 XT等消费级GPU上运行。这一发展消除了每token成本和外部维护的需要,标志着去中心化AI部署的重大转变。