PulseAugur
实时 10:34:25
English(EN) Multi-turn RL with Structural and Performance Aware Rewards for CUDA Kernel Generation

新框架 CudaPerf 通过结构化奖励增强 CUDA 核生成

研究人员开发了 CudaPerf,这是一个旨在改进 CUDA 核生成的创新强化学习框架。该系统结合了可验证的执行奖励和结构化代码感知奖励,解决了先前仅关注正确性和加速的方法的局限性。CudaPerf 分两个阶段进行:一个离线成对排序模块和一个在线强化学习训练阶段,后者共同优化正确性、性能和结构效率。该框架在各种基准测试中,与 Qwen 3 32BCUDA Agent 等现有基线相比,已显示出显著的改进,在加速和正确性方面取得了实质性进展。 AI

影响 这项研究可能带来更高效、更优化的 GPU 密集型任务代码生成,从而可能提高 AI 和科学计算应用的性能。

排序理由 关于新代码生成方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新框架 CudaPerf 通过结构化奖励增强 CUDA 核生成

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Quazi Ishtiaque Mahmud, Nesreen K. Ahmed, Ali Jannesari ·

    面向CUDA核生成的具有结构和性能感知奖励的多轮强化学习

    arXiv:2607.20908v1 Announce Type: cross Abstract: Reinforcement Learning with Verifiable Rewards (RLVR) has emerged as a powerful technique to enhance the reasoning capacity of LLMs for optimized code generation. However, existing RLVR approaches primarily rely on outcome-based s…