PulseAugur
实时 09:19:02
English(EN) Is This Your Final Answer? Cross-Contextual Consistency as a Measure of LLM Credibility

新的C3指标通过提示一致性衡量大型语言模型的可信度

研究人员推出了一种新的评估大型语言模型(LLM)可信度的方法——跨上下文一致性(C3)。C3衡量当以提示上下文的细微变化呈现相同任务时,LLM答案的稳定性。对26个模型和六个基准的研究表明,跨上下文偏移较小的答案更有可能是准确和事实性的。这种方法提供了一个补充性的评估维度,并有助于识别基准中可能被饱和的信息性部分。 AI

影响 引入了一种评估大型语言模型事实性和内部一致性的新方法,有望改进基准设计和模型的可信度。

排序理由 该集群描述了一篇介绍新LLM评估指标的新研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的C3指标通过提示一致性衡量大型语言模型的可信度

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Siyang Wu, Yibo Jiang, Bryon Aragam ·

    这是你的最终答案吗?跨上下文一致性作为衡量LLM可信度的指标

    arXiv:2608.10315v1 Announce Type: cross Abstract: Large language models (LLMs) are powerful black-box systems, making it difficult to discern whether their answers reflect stable internal beliefs or superficial pattern matching. We identify cross-contextual consistency as an unde…