研究人员开发了 VCoT-Lift 框架,旨在评估大型语言模型(LLMs)在执行 Rust 程序验证方面的能力。该框架将低级求解器推理转化为人类可读的验证步骤,创建了明确的验证思维链。在此基础上,他们推出了 VCoT-Bench 基准测试,包含 1,988 个任务,用于评估 LLMs 在证明完整性和类型等多个维度上对整个验证过程的理解。对十个最先进模型的初步评估显示出显著的脆弱性,表明当前 LLMs 尚未具备在此任务上媲美自动定理证明器的推理能力。 AI
影响 当前的大型语言模型在复杂的软件验证任务上缺乏自动定理证明器的推理能力。
排序理由 学术论文,介绍用于评估 LLMs 在特定任务上的新基准和框架。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →