一项名为 D2K-Bench 的新基准已被开发出来,用于评估大型语言模型 (LLM) 代理将专家设计指导转化为高效 GPU 内核的能力。该基准包含 26 个任务和 85 个工作负载,评估了从高级算法、数据流设计到低级优化等方面的指导。在 NVIDIA B200 GPU 上的结果表明,专家指导显著提高了正确性和性能,像 GPT-6-ASTRA、Claude Opus 4-8 和 GPT 5.6 "Sol" 这样的前沿模型实现了大幅加速。 AI
影响 该基准可以加速开发能够为专用硬件生成复杂代码的更高效的 AI 代理。
排序理由 该集群包含一篇介绍用于评估 LLM 代理的新基准的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →