PulseAugur
实时 11:01:57
English(EN) Can LLMs Reason Like Automated Theorem Provers for Rust Verification? VCoT-Bench: Evaluating via Verification Chain of Thought

研究发现:大型语言模型在 Rust 验证方面的推理能力不及定理证明器

研究人员开发了 VCoT-Lift 框架,旨在评估大型语言模型(LLMs)在执行 Rust 程序验证方面的能力。该框架将低级求解器推理转化为人类可读的验证步骤,创建了明确的验证思维链。在此基础上,他们推出了 VCoT-Bench 基准测试,包含 1,988 个任务,用于评估 LLMs 在证明完整性和类型等多个维度上对整个验证过程的理解。对十个最先进模型的初步评估显示出显著的脆弱性,表明当前 LLMs 尚未具备在此任务上媲美自动定理证明器的推理能力。 AI

影响 当前的大型语言模型在复杂的软件验证任务上缺乏自动定理证明器的推理能力。

排序理由 学术论文,介绍用于评估 LLMs 在特定任务上的新基准和框架。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

研究发现:大型语言模型在 Rust 验证方面的推理能力不及定理证明器

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Zichen Xie, Wenxi Wang ·

    大型语言模型能否像自动化定理证明器一样用于 Rust 验证?VCoT-Bench:通过验证思维链进行评估

    arXiv:2603.18334v2 Announce Type: replace-cross Abstract: As Large Language Models (LLMs) increasingly assist secure software development, their ability to meet the rigorous demands of Rust program verification remains unclear. Existing evaluations treat Rust verification as a bl…