PulseAugur
实时 00:51:00
实体 PutnamBench

PutnamBench

PulseAugur coverage of PutnamBench — every cluster mentioning PutnamBench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 6
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 4
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 6 条
  1. SIGNIFICANT · CL_124629 ·

    Mistral AI发布Leanstral 1.5,用于高级形式化验证

    Mistral AI发布了Leanstral 1.5,这是一个开源模型,专为形式化验证任务设计。该模型拥有60亿活跃参数,并以Apache 2.0许可证提供,在解决复杂数学问题和验证真实世界代码方面表现出显著的改进。Leanstral 1.5在证明工程等领域表现出色,并已在软件存储库中发现了一些先前未知的错误。

  2. TOOL · CL_92404 ·

    Pythagoras-Prover 在高效形式证明方面达到最先进水平

    研究人员推出了Pythagoras-Prover,这是一系列专为形式推理任务效率而设计的新型定理证明器。这些模型利用课程学习和增强形式化技术来克服已验证数据和证明搜索复杂性的限制。值得注意的是,4B参数版本在一个关键基准上优于一个规模大得多的模型,而32B版本则设定了新的开源最先进水平。

  3. TOOL · CL_74785 ·

    DeepSeek V4 驱动 Goedel-Architect 在低成本下赢得数学竞赛

    一个名为 Goedel-Architect 的新框架,由 DeepSeek V4 驱动,在 PutnamBench 数学竞赛中取得了 75.6% 的通过率。该框架具有显著的成本优势,成本仅为 294 美元,而类似系统的成本为 170,000 美元。研究人员将性能提升归因于架构创新,而非更优越的硬件。

  4. TOOL · CL_65645 ·

    新框架ECP形式化求解数学答案构造问题

    研究人员开发了一个名为Enumerate-Conjecture-Prove (ECP) 的新神经符号框架,旨在解决形式数学中的答案构造问题。该框架结合了用于提出候选答案的通用大语言模型和用于生成机器检查证明的专用证明器LLM。ECP在基准数据集上取得了成功,形式化地解决了部分具有可接受答案和证明的答案构造问题,其表现优于现有的LLM基线。

  5. RESEARCH · CL_62835 ·

    AI框架通过新技术提升形式化定理证明能力

    研究人员开发了新的框架,利用大型语言模型增强形式化定理证明能力。Goedel-Architect 采用蓝图生成和精炼策略,使用 DeepSeek-V4-Flash 模型在 MiniF2F-test 和 PutnamBench 等基准测试中取得了最先进的性能。Proof-Refactor 专注于提高 LLM 生成证明的模块化、可读性和可维护性,在 PutnamBench 数据集上表现优于现有基线。另一种方法 Compile to Com…

  6. RESEARCH · CL_62715 ·

    LLM针对Lean中的高效形式定理证明进行了优化

    两篇新研究论文探讨了在Lean环境中提高大型语言模型(LLM)在形式定理证明中的效率和有效性的方法。第一篇论文介绍了一种动作路由代理,该代理通过使用编译器反馈来指导搜索并降低计算成本,从而优化成本-质量权衡。第二篇论文提出了一种“反馈蒸馏”训练方法,该方法利用语言模型的反馈来改进令牌级别的监督和探索,在生成多样化且成功的证明轨迹方面优于传统的强化学习技术。