实体
Verina
Verina
PulseAugur coverage of Verina — every cluster mentioning Verina across labs, papers, and developer communities, ranked by signal.
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 3
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
-
新的大语言模型方法通过集成规划和证明搜索来增强可验证代码生成
研究人员开发了新的可验证代码生成方法,其中大语言模型(LLMs)同时生成可执行程序和机器可检查的正确性证明。第一种方法 P$^{3}$ 集成了程序和证明规划,以提高效率和有效性,在 Lean4Commit0 等基准测试上实现了更高的解决率并降低了成本。第二种方法 Goedel-Code-Prover 在 Lean 4 中采用了分层证明搜索,将复杂的验证目标分解为更简单的子目标,在其基准测试上实现了 62.0% 的证明成功率。
-
AI模型通过新的验证技术改进代码生成
研究人员开发了新方法来提高大型语言模型生成正确代码和证明的能力。一种方法 TTRL-CoCoV 使用置信度条件验证来增强无标签设置下的覆盖率和准确性,在多个基准测试中显示出显著的提升。另一项研究探索使用强化学习和递归推理来自动化形式验证,通过将证明生成视为结构化搜索过程,实现了更高的验证程序生成率。
-
新框架VeriScale改进了LLM代码生成基准测试
研究人员开发了VeriScale,一个旨在为评估大型语言模型生成的代码创建更鲁棒的基准测试的新框架。该框架使用对抗性方法来扩展然后缩减测试套件,从而揭示出简单基准测试可能忽略的模型弱点。在Verina基准测试上使用VeriScale进行的实验显示,最先进的LLM的性能显著下降,突显了当前评估方法的局限性。