研究人员推出SHADOWBENCH,一个旨在更可靠地评估自动形式化数学语句语义对齐的新基准。该基准使用一种名为SA-Pass的新颖指标,通过辅助“影子”语句验证生成的语句,以确保它们准确捕捉预期含义。在测试中,Claude Code (Opus 4.8) 结合 Numina-Lean-Agent 实现了 61.8% 的编译率和 11.2% 的 SA-Pass 分数。SA-Pass 指标与专家判断高度一致,实现了 98.8% 的二元一致性。 AI
影响 该基准可能促成更强大的AI系统,能够准确地将非形式化数学翻译成形式化代码。
排序理由 该集群描述了一篇介绍AI自动形式化新颖基准和评估指标的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- AI4Math Challenge
- Claude Code
- International Conference on Machine Learning
- Lean 4 Programming Language
- Numina-Lean-Agent
- Opus 4.8
- SA-Pass
- SHADOWBENCH
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →