PulseAugur
实时 07:01:01
English(EN) ProofJudge: Tool-Grounded LLM Evaluation of Formal Proof Quality in Mathlib

新的基于LLM的系统评估Mathlib中的形式化证明质量

研究人员开发了ProofJudge,一个使用大型语言模型(LLM)来评估Lean 4编程语言中形式化证明质量的新系统,特别是在Mathlib库内。该智能体系统超越了单纯的正确性,从库的利用、自动化匹配度、结构清晰度、陈述质量以及是否符合Mathlib约定等维度来评估证明。ProofJudge在包含218个pull request的数据集上进行了评估,并证明了其能够与人类评审者的偏好保持一致,其中一些开源模型以显著低于专有选项的成本实现了这种一致性。该项目旨在通过发布评判工具、评估数据集和追踪记录作为开源产物,来促进进一步的研究。 AI

影响 通过自动化证明质量评估,提高了数学和计算机科学中形式化验证的严谨性和效率。

排序理由 该条目描述了一篇介绍新的形式化证明质量评估系统的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的基于LLM的系统评估Mathlib中的形式化证明质量

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Shane Caldwell ·

    ProofJudge:用于数学库中形式证明质量的工具基础大模型评估

    arXiv:2608.20432v1 Announce Type: cross Abstract: Formal proofs in Lean 4 that pass the kernel's type checker can nonetheless vary widely in quality. We introduce ProofJudge, an agentic LLM-as-judge system that scores formal proof quality along five dimensions beyond correctness:…