研究人员开发了 CudaPerf,这是一个旨在改进 CUDA 核生成的创新强化学习框架。该系统结合了可验证的执行奖励和结构化代码感知奖励,解决了先前仅关注正确性和加速的方法的局限性。CudaPerf 分两个阶段进行:一个离线成对排序模块和一个在线强化学习训练阶段,后者共同优化正确性、性能和结构效率。该框架在各种基准测试中,与 Qwen 3 32B 和 CUDA Agent 等现有基线相比,已显示出显著的改进,在加速和正确性方面取得了实质性进展。 AI
影响 这项研究可能带来更高效、更优化的 GPU 密集型任务代码生成,从而可能提高 AI 和科学计算应用的性能。
排序理由 关于新代码生成方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- CUDA
- CUDA Agent
- CudaPerf
- PyTorch
- Quazi Ishtiaque Mahmud
- Qwen 3 32B
- Reinforcement Learning
- Reinforcement Learning with Verifiable Rewards (RLVR)
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →