PulseAugur
实时 08:36:40
English(EN) Uncertainty-Aware Trust Estimation for Multi-LLM Systems via Structured Expert Judgement

新方法利用专家判断和校准来估计LLM的信任度

研究人员开发了一种新颖的方法,通过改编结构化专家判断技术来估计多大型语言模型(LLM)系统的信任度。这种方法被称为不确定性感知信任度估计,它使用上下文感知校准问题来评估个体LLM的可靠性,基于其概率预测的质量。该方法受Cooke风格的对数加权启发,惩罚过于自信的错误预测,并偏好校准良好的专家。在MMLU和MMLU-Pro基准上的评估表明,该技术对于异构LLM设置至关重要,并且能够抵御不可靠或受污染的专家小组,其表现优于朴素聚合方法。 AI

影响 这项研究可以通过提供一种更复杂的方法来评估和组合模型预测,从而提高LLM集合的可靠性和鲁棒性。

排序理由 该集群包含一篇详细介绍LLM系统新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新方法利用专家判断和校准来估计LLM的信任度

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Jiawei Zheng, Jiazhen Zhang ·

    面向多LLM系统的结构化专家判断不确定性感知信任度估计

    arXiv:2607.20529v1 Announce Type: cross Abstract: Large Language Model (LLM) ensembles are increasingly used to improve reliability by combining predictions from multiple LLMs. However, existing aggregation methods typically assume that all models are equally trustworthy, overloo…