研究人员开发了 MathArena,这是一个用于评估大型语言模型数学推理能力的扩展评估平台。该平台超越了静态基准测试,能够持续更新和拓宽其范围,纳入证明生成和研究级问题等任务。增强后的 MathArena 现在包括 Lean 中的形式证明生成以及 arXiv 研究级问题,旨在为 LLM 在数学方面的进展提供更全面、更具挑战性的评估。 AI
影响 为评估 LLM 数学推理能力建立了新的、动态的标准,推动前沿模型实现新能力。
排序理由 该集群描述了一个用于 LLM 数学评估的新平台,详细介绍了其扩展范围和领先模型的性能指标。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →