PulseAugur
中
实时 03:16:23
实体 ComBench

ComBench

PulseAugur coverage of ComBench — every cluster mentioning ComBench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 1 条
  1. RESEARCH · CL_79513 ·

    新基准评估大型语言模型的数学推理和证明验证能力

    研究人员引入了新的基准和评估方法来评估大型语言模型的数学推理能力。ComBench 专注于奥林匹克级别的组合数学,区分证明推理和构造性实现,并发现即使是顶级模型也难以胜任这些复杂任务。另一种方法 TheoremBench 使用 Lean4 语言在形式数学中评估大型语言模型的定理证明能力,强调需要超越竞赛式问题来评估模型在更长、依赖性更强的数学发展中的表现。此外,一种用于严格逐级验证研究级证明的方法旨在通过仔细检查每个推理步骤来解决大型…