研究人员开发了一种新颖的方法,通过改编结构化专家判断技术来估计多大型语言模型(LLM)系统的信任度。这种方法被称为不确定性感知信任度估计,它使用上下文感知校准问题来评估个体LLM的可靠性,基于其概率预测的质量。该方法受Cooke风格的对数加权启发,惩罚过于自信的错误预测,并偏好校准良好的专家。在MMLU和MMLU-Pro基准上的评估表明,该技术对于异构LLM设置至关重要,并且能够抵御不可靠或受污染的专家小组,其表现优于朴素聚合方法。 AI
影响 这项研究可以通过提供一种更复杂的方法来评估和组合模型预测,从而提高LLM集合的可靠性和鲁棒性。
排序理由 该集群包含一篇详细介绍LLM系统新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →