Dafny
PulseAugur coverage of Dafny — every cluster mentioning Dafny across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新方法Re:Form利用形式化语言减少LLM软件验证中的人工标注
研究人员开发了一种名为Re:Form的新方法,以减少在形式化软件验证中训练大型语言模型(LLMs)所需的人工标注。通过利用Dafny等形式化语言并整合形式化语言验证器的反馈,该系统可以自动生成可验证的代码。这种方法在DafnyComp基准测试中得到了验证,即使是较小的模型也能生成语法正确且可验证的Dafny代码,其表现优于较大的专有模型和现有基线。
-
新系统Formal Disco可大规模生成已验证的代码数据集
研究人员开发了Formal Disco,一个旨在生成大量形式化验证程序数据集的可扩展系统。该系统采用分布式方法,包含三种类型的AI工作者:启动者负责勾画程序,修复者负责解决验证错误,扩展者负责扩展现有代码。Formal Disco旨在通过创建合成数据来克服形式化验证中的数据稀缺问题,这些数据已被用于微调开放模型,使其在与验证相关的任务上达到或超过Claude Opus 4.5的性能。该项目还引入了最大熵原理来生成多样化的程序,并发布了…
-
新的基准MINIF2F-DAFNY测试LLM的数学定理证明能力
研究人员开发了MINIF2F-DAFNY,这是一个用于评估大型语言模型(LLM)在数学定理证明方面的新基准。该系统将miniF2F基准转换为Dafny,一个自动主动验证器,使LLM能够指导证明生成,而Dafny的自动定理证明器则处理低级细节。在评估中,表现最佳的LLM Claude Opus-4.6 达到了 62.7% 的累积通过率,显著优于基线性能。
-
新基准揭示AI在验证代码生成方面存在困难
一个名为AlgoVeri的新基准已被开发出来,用于评估AI模型在为经典算法生成形式化验证代码方面的性能。该基准在三种语言:Dafny、Verus和Lean中测试模型,揭示了显著的能力差距。虽然Gemini-3 Flash在Dafny中表现出中等成功,但在Verus和Lean中的表现却显著下降,这凸显了在内存约束和显式证明构建方面的挑战。
-
AI模型通过新的验证技术改进代码生成
研究人员开发了新方法来提高大型语言模型生成正确代码和证明的能力。一种方法 TTRL-CoCoV 使用置信度条件验证来增强无标签设置下的覆盖率和准确性,在多个基准测试中显示出显著的提升。另一项研究探索使用强化学习和递归推理来自动化形式验证,通过将证明生成视为结构化搜索过程,实现了更高的验证程序生成率。
-
研究人员开发使用神经方法为命令式程序构建图
研究人员开发了一个管道,将命令式程序及其注解转换为类型化、属性化的图。该过程结合了抽象语法树解析与来自 SentenceTransformer 和 CodeBERT 等模型的语义嵌入。目标是识别程序之间的结构和语义相似性,以便重用验证工件。使用 C、Java 和 Dafny 进行的实验证明了跨不同语言和注解风格创建一致图表示的能力。
-
SEVerA 框架验证自进化 AI 代理的安全性与正确性
研究人员推出了 SEVerA,一个旨在通过形式化安全性和正确性保证来合成自进化 AI 代理的框架。该方法将代理代码生成视为一个受约束的学习问题,将形式化规范与任务效用目标相结合。SEVerA 采用形式化守护生成模型 (FGGM) 来封装底层模型,确保输出符合指定合同并提供经过验证的回退机制。该框架在程序验证和符号数学合成等任务中取得了成功,实现了零约束违规,同时优于无约束基线。
-
AI 模型在形式化代码生成中实现高验证成功率
研究人员开发了一个新的数据集 NL2VC-60,包含 60 个算法问题,旨在帮助从自然语言生成已验证的代码。他们评估了七个开源大语言模型(LLM),采用了多种提示策略,包括利用 Dafny 验证器反馈的自修复提示。这种方法显著提高了性能,其中 Gemma 4-31B 的验证成功率达到了 90.91%,而 GPT-OSS 120B 在引导反馈下达到了 81.82%。