PulseAugur
实时 07:04:05
实体 model checking

model checking

PulseAugur coverage of model checking — every cluster mentioning model checking across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_228738 ·

    新方法使用模型检查作为Oracle来测试LLM解释器

    研究人员开发了一种新颖的方法,用于自动测试大型语言模型(LLM)为顺序决策策略生成的解释的准确性。该方法利用概率模型检查作为Oracle,以评估LLM生成的解释与底层环境的忠实度。通过根据事后查询类别的分类法构建测试输入,并按诊断难度对测试用例进行优先级排序,该系统可以系统地评估LLM的性能。在七个环境中的实验表明,一个推理模型达到了85%的准确率,一个中型模型达到了70%,而一个1B模型表现低于随机基线,这凸显了在无模型设置中LLM…