实体
Claim-Level Reliability Assessment
Claim-Level Reliability Assessment
PulseAugur coverage of Claim-Level Reliability Assessment — every cluster mentioning Claim-Level Reliability Assessment across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
新框架通过关注声明证伪来改进 LLM 推理
研究人员推出了一种名为声明级可靠性评估(CLR)的新型无训练框架,旨在提高大型语言模型(LLM)在测试时推理的效率和准确性。CLR 通过将每个推理过程浓缩为一组关键声明来实现,从而进行有针对性的验证,而不是广泛的解决方案采样。该方法侧重于语义证伪,通过识别单一决定性缺陷,利用构建正确解决方案与驳斥错误声明之间的不对称性。实验表明,CLR 在 GPT-OSS-20B/CMIMC25 等基准测试上提高了性能,显著提高了 pass@1 准确…
-
新框架增强LLM时序推理评估
研究人员开发了新的框架,以更好地评估大型推理模型(LRM)的时序推理能力。一种方法TRACE,将时序推理建模为使用Allen区间代数的约束满足问题,从而实现细粒度的难度控制和基于迹的验证。另一种方法声明级可靠性评估(CLR),侧重于在推理过程中证伪关键声明,而不是验证整个过程,这可以减少令牌使用并提高准确性。这两种框架都旨在揭示传统基准可能忽略的推理缺陷,例如虚假猜测和与规模相关的故障模式。