一篇新的研究论文探讨了大型语言模型 (LLM) 在解决停机问题(计算机科学中一个基本不可判定问题)方面的能力。该研究评估了 GPT-5 和 Claude Sonnet 4.5 等模型在判断程序终止方面的能力,发现它们的性能与专用验证工具相当。然而,研究强调了一个显著的差距:尽管 LLM 经常能识别终止,但它们难以生成形式化证明,这表明其在符号推理方面存在局限性。 AI
排序理由 该集群包含一篇详细介绍 LLM 能力研究的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- Claude Sonnet 4.5
- GPT-5
- Halting Problem
- International Competition on Software Verification (SV Comp) 2025
- Oren Sultan
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →