PulseAugur
中
实时 11:10:45
实体 Lean

Lean

PulseAugur coverage of Lean — every cluster mentioning Lean across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
143
90 天内 144
发布 · 30天
0
90 天内 0
论文 · 30天
106
90 天内 107
层级分布 · 90 天
主题
关系
情绪 · 30 天

14 天有情绪数据

最近 · 第 1/8 页 · 共 149 条
  1. COMMENTARY · CL_286163 ·

    Lean证明系统验证形式化数学,而非AI翻译的准确性

    Lean证明验证系统可以确认形式化数学陈述的正确性,但它不能自动验证翻译成形式化代码的原始自然语言论证的准确性。这一区别至关重要,因为AI模型在翻译过程中可能会改变底层的数学推理,即使最终的形式化证明是有效的。人类的监督对于确保AI的翻译准确反映原始意图仍然是必要的。

  2. TOOL · CL_286034 ·

    OpenAI的Lean证明应用于患者记忆实验

    OpenAI发布的Lean证明已被用于创建一个具体的实验,用于在医疗背景下更新患者记忆。这项工作在urbanmind.net上进行了详细介绍,探讨了形式化验证方法在临床场景中的应用。该实验旨在独立验证管理患者记忆的规则,从而提高医疗AI系统的可靠性。

  3. COMMENTARY · CL_285756 ·

    精益和敏捷原则在应对快速技术变革中仍然至关重要

    作者提倡坚持精益和敏捷原则,以应对技术快速发展的步伐,尤其是在软件开发工具方面。他们讲述了他们的团队开发了一种安全使用 Claude Code 的方法,但 Anthropic 随后发布的“自动模式”使他们的解决方案过时了。这次经历凸显了保持适应性和不带个人色彩的必要性,不断验证假设,并以小而正确的方式交付软件。

  4. RESEARCH · CL_285693 ·

    AI 辅助证明最优打包 11 个正方形已验证

    使用 Lean 证明助手成功验证了 AI 辅助证明的最优打包 11 个正方形。该证明在 Lean 4.34.1 和 Mathlib revision d13f23b723b8a846827a245b89c10fc7d3f11612 中形式化,通过了所有 7,920 个本地 Lean 模块的验证,无需任何假设。该存储库包含精确的证明源文件和构建配置,允许独立验证。最优边长源自一个复杂的多项式方程,并且该构造允许任意方向和不相交的内部。

  5. SIGNIFICANT · CL_285810 ·

    OpenAI 未发布的模型产生大量数学发现

    OpenAI 发布了来自未发布前沿模型的重大产出,在各个领域生成了海量的数学结果。这些发现,包括过去三年中 81% 的主要数学发现,仅用了相当于三小时 ChatGPT Pro 计算时间就产生了。虽然一些结果已经得到验证,但其庞大的数量和复杂性表明,未来机器数学可能与人类理解力分道扬镳,为人类理解创造一个“有效理论”。

  6. TOOL · CL_285196 ·

    OpenAI 在 Lean 验证的存储库中发布 722 篇数学论文

    OpenAI 发布了一个包含 722 篇手稿的存储库,这些手稿被组织成 372 个结果家族。其中一些手稿已在 Lean 语言中进行了机器验证。然而,逻辑正确性的验证并不决定其科学意义。

  7. TOOL · CL_284429 ·

    AI数学证明验证存在缺陷,论文声称

    一篇新论文质疑了人工智能驱动的数学证明验证的可靠性,特别是在将自然语言证明翻译成 Lean 等形式化语言时。研究强调,在此翻译过程中,语义忠实性是一个任意高计算复杂度的问题,比解决停机问题更难。提供的例子包括与 OpenAI 宣布的关于 Navier-Stokes 方程的证明相关的误译,表明自然语言证明与其形式化 Lean 验证之间存在不匹配。

  8. TOOL · CL_284328 ·

    新的SCOPE系统使用LLM进行认证定理证明

    一篇新的研究论文介绍了SCOPE,一个旨在改进Lean等证明助手中的认证定理证明的系统。SCOPE将语言模型规划证明步骤与执行数值计算的符号引擎之间的劳动进行了划分,提高了复杂命题的准确性。该方法在使用一个1.35亿参数的模型在218个问题的套件上实现了87.6%的认证率,在某些指标上显著优于更大的模型,并展示了一条比简单扩大模型规模更直接的可靠证明路径。

  9. FRONTIER RELEASE · CL_284068 ·

    OpenAI 发布 722 篇 AI 生成的数学手稿,引发验证争议 · 追踪 8 个来源

    OpenAI 发布了由一个未发布的 Frontier 模型生成的 722 篇数学手稿,涵盖了多个领域数百个开放数学问题的解决方案。这些结果平均花费了每个 ChatGPT Pro 三小时的计算时间,包括用于机械验证的 Lean 形式化,尽管并非所有手稿都已完全验证。此次发布旨在将研究瓶颈从 AI 回答数学难题的能力转移到人类验证、理解和构建机器生成研究的能力上。

  10. SIGNIFICANT · CL_283971 ·

    OpenAI 发布数百个数学解题方案,引发数学家争论 · 跟踪 8 个来源

    OpenAI 发布了数百个解题方案,并在 372 个重大数学问题上取得进展,使用了未发布的模型并将研究结果发布在 GitHub 上。此举在数学界引发了争论,一些人对新的探索途径表示兴奋,另一些人则对方法论和对人类数学研究的潜在影响表示担忧。批评者质疑该过程的透明度、结果的普适性以及使用专有 AI 模型进行学术发现的伦理影响,而 OpenAI 则表示致力于改进未来的发布并与咨询小组合作。

  11. TOOL · CL_283844 ·

    Astra 和 Claude 在 Lean 中形式化最优平方打包证明

    一个关于 11 个正方形最优平方打包的数学证明已使用 Lean 证明助手进行了形式化。这一成就得益于 Astra 和 Claude 的合作努力,展示了形式化验证在数学中的力量。

  12. COMMENTARY · CL_282701 ·

    数学家陶哲轩呼吁AI放缓步伐,称存在“证明消化不良”

    著名数学家陶哲轩公开表达了对模型公司快速、不受控制的AI发展步伐的担忧。他认为,尽管AI正在迅速解决复杂的数学问题,但理解、传播和将这些证明融入更广泛知识的关键步骤却被忽视了。这种“证明消化不良”可能会扼杀数学创造力,并导致未来AI训练的数据污染。针对这些担忧以及25位菲尔兹奖得主的相关抗议,OpenAI已成立一个咨询小组,以帮助管理AI驱动的数学研究的审查和传播,但该小组不会就内部进展提供建议。

  13. TOOL · CL_282061 ·

    OpenAI Dots代理群打破了47年历史的数学记录

    一位用户利用OpenAI的Dots(一个代理群系统)解决了一个复杂的数学问题,打破了一项有47年历史的记录。该解决方案使用Lean(一个定理证明器)进行了验证。这一演示突显了AI代理群在科学发现和解决问题方面的潜力。

  14. SIGNIFICANT · CL_281017 ·

    OpenAI的AI解决重大数学难题,引发争议

    OpenAI宣布在解决复杂数学问题方面取得重大进展,包括可能解决了纳维-斯托克斯存在性与光滑性问题,这是千禧年大奖难题之一。这项由内部前沿模型实现的进展,在数学界引发了广泛的讨论和一些争议。虽然一些人将这些AI驱动的解决方案视为基准和公关噱头,但另一些人则对这些突破的方法和沟通方式表示担忧,特别是关于透明度以及对传统数学研究的潜在影响。

  15. TOOL · CL_280145 ·

    新的ReRoute框架能够在科学模拟器中进行反事实预测

    研究人员开发了ReRoute,这是一个新颖的框架,旨在科学模拟器中进行反事实预测,而无需进行对照实验。该方法结合了事实数据和部分机械知识,通过将查询输入固定到参考值并通过已知路径重新引入变异,从而能够回答“假设”问题。ReRoute在气候模拟的准确性方面显示出显著的改进,在保留的干预措施上将总体气候误差降低了多达31.8%,并在标准条件下保持了技能。

  16. TOOL · CL_279702 ·

    Scott Armstrong 使用 Lean/Mathlib 简化复杂数学证明的形式化

    Scott Armstrong 已经证明,使用 Lean 证明助手及其相关的 Mathlib 库,可以在 24-48 小时内完成复杂数学证明的形式化,包括与 PDE 和概率论相关的证明。他在一篇博客文章中详细介绍了这一过程,强调了 Lean/Mathlib 生态系统中自动定理证明生产力的显著提高。

  17. TOOL · CL_277277 ·

    新AI框架通过增强式突变技能进化提升定理证明能力

    研究人员开发了SkillEvoLean,一个用于增强大型语言模型在形式化定理证明中能力的框架。该方法采用增强式突变技能进化,它同时更新高级求解策略和参考知识。当标准方法未能找到成功路径时,SkillEvoLean使用突变来采样数学概念并生成新的技能候选。在MiniF2F和PutnamBench等基准测试以及IMO 2025和USAMO 2026问题上使用GPT-5.5进行测试,SkillEvoLean相比基线方法实现了显著更高的证明成功率。

  18. TOOL · CL_275258 ·

    LeanPolish 管道通过已验证的编辑增强了 AI 生成的 Lean 证明

    研究人员开发了 LeanPolish,这是一个用于 Lean 4 编程语言的符号管道,用于生成已验证的证明编辑,以改进语言模型生成的证明。该系统发布了 33,402 个已接受的编辑和 65,596 个失败的尝试,从而能够研究模型从这种监督中学到了什么。在评估时,使用 LeanPolish 训练的排序器在 70.1% 的保留状态下选择了最佳候选证明,显著优于冻结基线。该管道还增强了证明压缩,增加了在 miniF2F 基准测试上的节省,并…

  19. RESEARCH · CL_273175 ·

    多智能体系统在数学和软件验证中推进自动证明发现 · 跟踪 5 个来源

    研究人员开发了先进的多智能体系统,用于形式数学和软件验证中的自动证明发现。其中一个框架 FORALL-LEAN-AGENT 通过结合隔离的工作空间和独立的证明检查来增强可审计推理,提高了成功率并降低了 VeriSoftBench 和 PutnamBench 等基准测试的成本。另一个系统 Cogentic 利用带有协调器和专用智能体的迭代证明-验证循环来解决开放研究问题,使用 Gemini 等模型在复杂的数学和理论计算机科学挑战中展示了新颖的结果。

  20. TOOL · CL_273166 ·

    新的人机协同系统FYAN增强了数学形式化能力

    研究人员开发了FYAN,一个新颖的人机协同系统,专为数学定理的文档级形式化而设计。FYAN整合了从规范、证明规划到逻辑审查和Lean证明构建的全面工作流程,并纳入了语义审计,以确保形式化陈述准确反映其非形式化规范。使用DeepSeek-V4.1-Flash模型,FYAN在FormalTCS定理上的表现优于通用代理协同系统,并提高了自然语言证明分数。该系统还在ConsistencyCheck上有效识别了不一致的陈述,并为创建大量的常微分…