研究人员推出了一种新的评估大型语言模型(LLM)可信度的方法——跨上下文一致性(C3)。C3衡量当以提示上下文的细微变化呈现相同任务时,LLM答案的稳定性。对26个模型和六个基准的研究表明,跨上下文偏移较小的答案更有可能是准确和事实性的。这种方法提供了一个补充性的评估维度,并有助于识别基准中可能被饱和的信息性部分。 AI
影响 引入了一种评估大型语言模型事实性和内部一致性的新方法,有望改进基准设计和模型的可信度。
排序理由 该集群描述了一篇介绍新LLM评估指标的新研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- Cross-Contextual Consistency
- DagsHub
- Gotit.pub
- Hugging Face
- LLM
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →