研究人员开发了NL2AGBench,这是一个新的基准,旨在评估大型语言模型将非正式几何问题转化为AlphaGeometry所需的正式语言的能力。这一点至关重要,因为AlphaGeometry在国际数学奥林匹克竞赛中表现接近金牌选手水平,它需要专门的领域特定语言作为输入,而手动转换是一个重大的瓶颈。该基准使用AlphaGeometry内的基于执行的验证来评估翻译质量。实验表明,领先的闭源LLM实现了超过80%的可执行翻译率,显著优于难以生成有效形式化的开源模型。 AI
影响 该基准可以加速能够形式化复杂数学问题的LLM的开发,可能有助于自动化定理证明和科学发现。
排序理由 该集群描述了一篇介绍用于评估LLM在特定领域能力的基准的新学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- AlphaGeometry
- arXiv
- domain-specific language
- Hugging Face
- International Mathematical Olympiad
- Large language models
- NL2AGBench
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →