实体
SOL-ExecBench
SOL-ExecBench
PulseAugur coverage of SOL-ExecBench — every cluster mentioning SOL-ExecBench across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
新框架优化深度学习和 HPC 的 GPU 内核 · 跟踪 3 个来源
三篇新研究论文介绍了用于优化 GPU 内核的先进框架,这对于深度学习和高性能计算至关重要。HIERA 专注于跨 PyTorch 和 CUDA 等不同实现空间的感知工作负载规划,展示了更高的效率和性能。AsmEvo 在 AMD GPU 的汇编级别进行优化,验证功能等价性并在生产工作负载上实现显著加速。KernelArc 在 NVIDIA GPU 上采用多智能体框架进行自主优化,通过协调专业智能体在基准排行榜上获得顶级排名。
-
AI生成的CUDA内核导致深度学习训练中出现静默错误
旨在加速深度学习计算的AI生成的CUDA内核,已被发现会引入微妙且难以检测的错误。这些内核通过了NVIDIA的SOL-ExecBench基准测试,但在实际训练场景中却出现了问题,导致诸如损失发散等故障。问题源于嵌入梯度bf16累积中的精度错误,这些错误会被AdamW等某些优化器或特定数据集所掩盖,从而难以诊断。