PulseAugur
实时 10:08:47
实体 IMO-GradingBench

IMO-GradingBench

PulseAugur coverage of IMO-GradingBench — every cluster mentioning IMO-GradingBench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_180444 ·

    廉价大模型在数学证明评分方面可媲美前沿模型

    一篇新的arXiv论文探讨了使用较小的、开放权重语言模型来评判数学证明的成本效益。研究发现,像GPT-OSS 120B、DeepSeek-V4 Flash和Gemma-4 31B这样的模型,在评分准确性方面可以媲美Claude Opus 4.7和Gemini 3.1 Pro等更昂贵的模型。研究人员提出,要求三个预算模型达成一致意见能提供最高的准确性和精确度,尽管这一具体规则需要独立验证。