PulseAugur
实时 04:47:16
实体 PerfReasoning

PerfReasoning

PulseAugur coverage of PerfReasoning — every cluster mentioning PerfReasoning across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. RESEARCH · CL_237020 ·

    新基准揭示大型语言模型在硬件性能建模方面存在困难

    一项名为PerfReasoning的新基准已被开发出来,用于评估大型语言模型(LLMs)在推理硬件性能和构建性能模型方面的能力。虽然顶级的闭源模型在推理任务上的准确率超过90%,但构建实际性能模型仍然具有挑战性,即使是像GPT-5.6 Sol这样先进的模型也难以超过80%,而其他模型平均准确率低于15%。该基准突显了大型语言模型理论推理能力与其在性能建模中的实际应用之间的差距,而特定任务的强化学习在提高性能方面显示出希望。