研究人员开发了OEIS Open,这是一个旨在评估语言模型能够证明多少数学猜想的新基准。该基准基于来自整数数列在线百科(On-Line Encyclopedia of Integer Sequences)的492个开放猜想,并已在Lean中形式化,允许通用语言模型自主尝试证明。初步结果表明,语言模型能够以适度的成本解决其中很大一部分猜想,其中一个模型在使用每次200美元的预算时,在一个基准子集上取得了44%的得分。 AI
影响 展示了语言模型自主解决开放研究猜想的潜力,可能加速数学发现。
排序理由 该集群描述了一个新的基准和研究论文,评估语言模型在数学猜想上的表现。
在 Hugging Face Daily Papers 阅读 →
- arXiv
- Language Models
- Lean
- OEIS Open
- On-Line Encyclopedia of Integer Sequences
- Thomas Adamczewski
- Tsoukalas et al.
- OEIS Open Lite
- Tsoukalas
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →