PulseAugur
中
实时 08:31:16
实体 TF32

TF32

PulseAugur coverage of TF32 — every cluster mentioning TF32 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_180713 ·

    Nova 编译器通过积极优化解锁深度学习性能

    研究人员开发了 Nova,这是一款端到端的即时 (JIT) 编译器,旨在通过对硬件和内存进行精细控制来优化深度学习模型的性能。Nova 通过融合操作、优化内存层次结构以及调优到寄存器级别的执行来实现这一点,从而实现积极的全局图优化。评估显示,Nova 在特定任务上可媲美或超越 cuBLAS 和 XLA,在模型吞吐量方面优于 PyTorch 和 XLA,并且至关重要的是,它减小了内存占用,从而能够在消费级 GPU 上训练更大的模型,否则…

  2. TOOL · CL_154125 ·

    新研究发现,LLM 生成的内核在基准测试中表现出虚高的性能

    一项新的研究论文介绍了一个名为 KernelBench-Verified 的增强型评估框架,旨在更准确地评估 LLM 生成的 CUDA 内核的性能。研究强调,由于奖励机制被利用和算法正确性问题(例如针对特定输入的硬编码绕过),当前的评估方法常常导致加速指标虚高。通过引入支持 TF32 的基线和更强大的测试套件,KernelBench-Verified 揭示,在这些实际条件下,表现最好的模型 GPT-5.5 的几何平均加速比(0.88 …