PulseAugur
中
实时 17:43:38
实体 Mathlib

Mathlib

PulseAugur coverage of Mathlib — every cluster mentioning Mathlib across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
32
90 天内 32
发布 · 30天
0
90 天内 0
论文 · 30天
29
90 天内 29
层级分布 · 90 天
主题
关系
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/2 页 · 共 34 条
  1. RESEARCH · CL_285693 ·

    AI 辅助证明最优打包 11 个正方形已验证

    使用 Lean 证明助手成功验证了 AI 辅助证明的最优打包 11 个正方形。该证明在 Lean 4.34.1 和 Mathlib revision d13f23b723b8a846827a245b89c10fc7d3f11612 中形式化,通过了所有 7,920 个本地 Lean 模块的验证,无需任何假设。该存储库包含精确的证明源文件和构建配置,允许独立验证。最优边长源自一个复杂的多项式方程,并且该构造允许任意方向和不相交的内部。

  2. TOOL · CL_279702 ·

    Scott Armstrong 使用 Lean/Mathlib 简化复杂数学证明的形式化

    Scott Armstrong 已经证明,使用 Lean 证明助手及其相关的 Mathlib 库,可以在 24-48 小时内完成复杂数学证明的形式化,包括与 PDE 和概率论相关的证明。他在一篇博客文章中详细介绍了这一过程,强调了 Lean/Mathlib 生态系统中自动定理证明生产力的显著提高。

  3. TOOL · CL_241106 ·

    Anthropic 的费马证明分析:1300 万行源于步数而非冗长

    对 Anthropic 对费马大定理的正式证明进行的分析显示,报告的 1300 万行 Lean 代码是准确的,但其长度是由于生成的步数异常多,而不是单个步数冗长。该证明包含 562,341 个声明,远多于人类编写的 Mathlib 中的 185,411 个。虽然 Anthropic 的工作中中位证明步数为 8 行,而 Mathlib 为 4 行,但其巨大尺寸的主要驱动因素是机器生成的步数的庞大规模。

  4. RESEARCH · CL_245224 ·

    新的 StochBench 基准测试 LLM 在 Lean 中处理随机过程 · 跟踪 2 个来源

    研究人员推出了 StochBench,这是一个旨在评估大型语言模型在 Lean 4 编程语言中处理随机过程能力的新基准。该基准包含 450 个研究生级别的难题,涵盖了马尔可夫链、布朗运动和随机微积分等领域,这些领域在现有的以数学为中心的基准中常常代表性不足。一个使用 Opus 4.8 的代理在 15 分钟内每个问题解决时限内,在 StochBench 上达到了 34.9% 的证明率,这表明该基准对高级证明器来说具有挑战性。

  5. TOOL · CL_239853 ·

    Anthropic 的 Claude 使用外部工具形式化了费马大定理

    Anthropic 的 Claude 模型在 11 天内成功将费马大定理形式化为 Lean 代码,生成了 1300 万行代码,并证明了超过 29,500 个中间定理。然而,这一成就涉及将 Andrew Wiles 的现有证明翻译成可验证的计算机格式,而不是发现新的数学见解。该过程严重依赖外部开源基础设施,特别是哥伦比亚大学的 Prove2Me 平台,凸显了工具在 AI 驱动的形式化中的重要性。

  6. RESEARCH · CL_240236 ·

    Claude AI 在 11 天内正式化费马大定理,创建可机器校验的证明 · 跟踪 4 个来源

    Anthropic 的 AI 模型 Claude 在短短 11 天内成功正式化了费马大定理,这项任务人类数学家估计需要五年时间。该 AI 生成了约 1300 万行 Lean 代码,创建了该定理第一个完全可机器校验的证明。虽然 Claude 并未发现新的证明,但其工作显著加速了验证复杂数学推理的过程,可能为 AI 协助正式化未来研究铺平道路。

  7. SIGNIFICANT · CL_236877 ·

    Anthropic 的 Claude AI 在 11 天内完成费马大定理形式化证明 · 跟踪 1 个来源

    Anthropic 的 Claude AI 已成功完成了费马大定理的首个端到端、计算机可验证的形式化证明。该 AI 系统在包括 Tianyi Peng 在内的研究人员的指导下,利用了大约 1300 万行 Lean 代码和超过 30,000 个中间定理,在短短 11 天内完成了这一壮举。这一成就显著加速了此前耗时数年、由人类主导的形式化定理的努力,展示了 Claude 在复杂数学推理和大规模代码生成方面的先进能力。该项目利用了一个名为 …

  8. RESEARCH · CL_236635 ·

    Anthropic 的 Claude AI 已将费马大定理证明形式化 · 跟踪 8 个来源

    Anthropic 的 AI 模型 Claude 使用 Lean 证明助手成功形式化了费马大定理的完整证明。这项历时 11 天的重大成就,涉及生成数百万行代码和数千个中间定理。虽然形式化验证了一个现有的数学证明路线,但它代表了 AI 辅助自动形式化的重大进展,展示了大型语言模型解决复杂、可验证数学挑战的能力。

  9. TOOL · CL_236591 ·

    Anthropic 的 Claude AI 使用 1300 万行证明形式化了费马大定理

    Anthropic 的 AI 模型 Claude 成功完成了费马大定理这一复杂数学证明的形式化。专家曾预测这项工作需要很多年才能完成,它涉及将证明转换为计算机证明助手(如 Lean)可验证的格式。该形式化证明是 Lean 中有史以来最大的证明,包含超过 1300 万行代码,并包含了对 29,000 多个不同数学领域的先决定理的机器验证。这一发展被视为巩固数学知识的重大进步,并可能有助于减轻在证明生成日益增多的时代人类审稿人的负担。

  10. RESEARCH · CL_236598 ·

    Anthropic的Claude AI完成了费马大定理的首次计算机验证证明 · 跟踪4个来源

    Anthropic宣布首次使用Lean 4编程语言完成了费马大定理的完整、计算机验证的形式化。一个基于Claude的内部研究模型自主工作了11天,生成了该证明,其中涉及编写约1300万行Lean代码,并证明了超过29,500个中间定理。这一成就对Andrew Wiles现有的1995年证明进行了形式化,而不是发现了新的数学,并展示了AI辅助形式化在复杂数学推理方面的鲁棒性。

  11. RESEARCH · CL_235380 ·

    AI系统AutoGraphForge自动化图论猜想发现与证明

    研究人员开发了AutoGraphForge,一个旨在自动化图论猜想发现和证明的计算流程。该系统使用反例引导方法生成猜想,过滤其新颖性,并在大型图数据集上进行测试。然后,使用集成的神经证明器对存活的猜想进行形式化和证明,并使用Lean 4形式化框架验证证明。该过程已产生超过6,500个猜想,包括图属性之间的新关系,目前正在进行完整的流程验证。

  12. RESEARCH · CL_215942 ·

    新LLM工具ProofJudge评估Mathlib中的形式化证明质量

    研究人员开发了ProofJudge,一个基于LLM的系统,用于评估在Mathlib库中用Lean 4编程语言编写的形式化证明的质量。该代理系统在五个标准上评估证明,这些标准超出了单纯的正确性,包括库利用、自动化匹配、结构清晰度、陈述质量和对Mathlib约定的遵守程度。ProofJudge在218个Mathlib pull request的数据集上进行了评估,证明其与人类审阅者偏好的匹配程度显著高于随机水平,其中一些开源模型以较低的成…

  13. TOOL · CL_205904 ·

    新AI管道使用Lean 4验证数学定理的新颖性

    研究人员开发了一个名为AViD Journal的新管道,该管道使用Lean 4编程语言自动验证数学定理的新颖性。该系统分析LaTeX文章,将陈述形式化为Lean 4,然后通过与形式化(Mathlib)和非形式化(TheoremSearch, Matlas)定理索引进行比较来评估新颖性。它还使用自动策略评估非平凡性,并通过Jaccard距离测量证明相似性,尽管在语义保真度、索引覆盖率和可复现性方面仍存在挑战。

  14. COMMENTARY · CL_202178 ·

    AI辅助数学形式化访谈系列启动

    此帖子的作者正在启动一个访谈系列,重点关注在形式化方法和数学形式化领域工作的人员,特别是在Lean编程语言的背景下。第一集采访了Logical Intelligence的技术人员Tanner Duve,他讨论了他在Lean中形式化验证和编译器方面的工作。对话还涉及AI在数学形式化中的作用,Duve对Mathlib和CSLib等开源项目的贡献,以及他的D1足球背景。

  15. RESEARCH · CL_203902 ·

    MathForm框架通过检索和精炼扩展数学自动形式化

    研究人员开发了MathForm,一个旨在改进将数学陈述自动形式化为Lean 4等机器可验证语言的框架。该框架整合了来自Mathlib等库的知识检索,并使用由验证反馈引导的迭代精炼来提高准确性。该系统已被用于创建FormalVerse,一个包含约367,000个已验证Lean 4示例的数据集,并用于训练MathForm-8B模型,该模型在各种基准测试中的表现优于更大的模型。

  16. TOOL · CL_195233 ·

    LeanScreen 工具检查形式数学证明的一致性

    LeanScreen 是一款旨在评估数学证明与其声明意图之间一致性的新工具。它作为一个本地、快速的检查器,可以识别形式证明中潜在的问题,例如一个声称证明完美数存在的定理实际上只陈述了一个重言式。该工具旨在帮助用户在最终确定其形式数学陈述之前,确保其正确性。

  17. RESEARCH · CL_178242 ·

    AI框架助力发现重大数学猜想

    研究人员开发了旨在发现重要数学猜想的新AI框架,超越了人类直觉。其中一种方法在arXiv上进行了详细介绍,该方法使用一个三阶段的流程,包括区域搜索、反思性验证以及在Lean 4和Mathlib中的形式化检查,以生成和验证潜在的数学问题。另一个框架MECA采用了一个多代理系统,包含探索者和批评者代理,共同开发候选陈述及其支持机制,确保猜想的规范性和价值。

  18. TOOL · CL_158529 ·

    新框架在 Lean 中自动化几何问题形式化

    研究人员开发了 Euclean,一个旨在 Lean 证明助手内自动化几何问题形式化的新框架。该系统通过使几何问题能够以原生的 Mathlib(Lean 的标准库)表示,解决了代数和几何推理系统之间的碎片化问题。Euclean 构建了大型数据集 OMNI-Geometry 和 Numina-Geometry,包含超过 178,000 个几何问题,这些数据集已证明能提高神经定理证明模型的性能。

  19. TOOL · CL_154074 ·

    新方法PriorProof衡量形式数学证明中的新颖性

    研究人员开发了PriorProof,一种衡量形式数学证明中使用的技术新颖性的新方法。该系统分析了Lean定理证明器中证明项的依赖足迹,并根据Mathlib库的历史快照对其意外性进行评分。PriorProof无需人工标记的本体或明确的技术分类即可运行,而是从证明派生的对比对中学习语句检索。

  20. TOOL · CL_139570 ·

    AI辅助的Vlasov方程形式化已在arXiv上发表

    研究人员使用一个由数学家在Lean 4证明助手指导下的AI系统,正式化了Vlasov方程的均场推导。这个过程被构建为一个策略游戏,涉及将LaTeX文档转换为可验证的Lean代码,AI在人类指导下执行任务。该形式化成功认证了非线性Vlasov方程的存在性、唯一性和稳定性估计,其中最优传输机制被开发为一个可重用组件,与Mathlib兼容。