PulseAugur
实时 22:27:50
实体 miniF2F-test

miniF2F-test

PulseAugur coverage of miniF2F-test — every cluster mentioning miniF2F-test across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 6
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 6
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 6 条
  1. RESEARCH · CL_117485 ·

    精简定理证明基准和RL模型推理中发现的缺陷

    研究人员在精简定理证明数据集的正式基准测试中发现了重大缺陷,揭示了数千个问题,包括反例和空泛定理。另一项关于RL训练的精简定理证明器的研究表明,这些模型存在推理时模式崩溃的问题,即增加采样预算并不会带来更多已解决的定理。然而,结构化策略骨架等干预措施可以提高性能,这表明推理时多样性是增强RL训练证明器的关键且独立的维度。

  2. RESEARCH · CL_115237 ·

    新矩阵改进LLM自动形式化错误分析

    研究人员引入了一个“信号覆盖矩阵”,以更好地评估大型语言模型(LLM)在自动形式化任务中的性能。该矩阵将错误分为类型正确性和语义等价性两类,超越了单一标量指标。在ProofNet#和MiniF2F-test上使用DeepSeek V4-Pro进行的实验表明,虽然总体真实成功率显著提高,但大部分增长来自于恢复类型级错误,而语义错误的改进较少,甚至出现新的错误。

  3. RESEARCH · CL_91340 ·

    新的大语言模型框架和基准推动形式数学推理发展

    研究人员正在开发新的方法和基准来提高大语言模型(LLMs)的形式数学推理能力。一种名为Diffusion-Proof的方法利用扩散大语言模型(dLLMs)进行定理证明,在ProofNet-Test和MiniF2F-Test等基准测试中表现优于自回归模型,甚至解决了领先模型无法解决的国际数学奥林匹克问题。另一项开发Visored提供了一个旨在通过模仿自然语言和自动化常规步骤来处理大语言模型生成数学的证明器。此外,Mask-Proof引入…

  4. TOOL · CL_92404 ·

    Pythagoras-Prover 在高效形式证明方面达到最先进水平

    研究人员推出了Pythagoras-Prover,这是一系列专为形式推理任务效率而设计的新型定理证明器。这些模型利用课程学习和增强形式化技术来克服已验证数据和证明搜索复杂性的限制。值得注意的是,4B参数版本在一个关键基准上优于一个规模大得多的模型,而32B版本则设定了新的开源最先进水平。

  5. RESEARCH · CL_62835 ·

    AI框架通过新技术提升形式化定理证明能力

    研究人员开发了新的框架,利用大型语言模型增强形式化定理证明能力。Goedel-Architect 采用蓝图生成和精炼策略,使用 DeepSeek-V4-Flash 模型在 MiniF2F-test 和 PutnamBench 等基准测试中取得了最先进的性能。Proof-Refactor 专注于提高 LLM 生成证明的模块化、可读性和可维护性,在 PutnamBench 数据集上表现优于现有基线。另一种方法 Compile to Com…

  6. TOOL · CL_51302 ·

    知识图谱助力大型语言模型进行自动化定理证明

    研究人员开发了KG-Prover,一个新框架,通过整合从数学文本中挖掘的知识图谱,增强大型语言模型进行自动化定理证明的能力。该方法有助于大型语言模型识别关键概念、理解它们之间的关系并更准确地形式化证明。在测试中,KG-Prover显著提高了大型语言模型的性能,在miniF2F-test数据集上提升高达21%,并在ProofNet和MUSTARD等其他基准测试中持续改进。