PulseAugur
实时 06:24:59
实体 Expected Calibration Error

Expected Calibration Error

PulseAugur coverage of Expected Calibration Error — every cluster mentioning Expected Calibration Error across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 5
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 5
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 5 条
  1. TOOL · CL_173944 ·

    新分析提高了对用于校准的等渗回归的理解

    研究人员开发了一种新方法来分析二元等渗回归,这是一种用于估计单调函数和校准概率预测器的技术。该研究为该方法应用于二元样本时的自由度提供了精确的有限样本特征,通过 $\frac{3}{(4\pi^2)^{1/3}} n^{2/3}$ 的前导项改进了现有界限。该分析还首次为等渗回归的预期校准误差 (ECE) 提供了非平凡的无分布保证,提供了一个无模型且无分布的界限。

  2. TOOL · CL_119601 ·

    新的ACE框架提供了更公平的大型语言模型校准比较

    一个名为ACE的新框架已被开发出来,用于提供对大型语言模型校准更准确、更公平的比较。现有的使用预期校准误差和Brier分数等全局指标的方法,由于模型准确性的差异而受到混淆。ACE通过其实例对齐、分布对齐和候选对齐视图,通过控制准确性来解决这个问题。使用ACE的研究表明,在准确性控制后,许多先前观察到的校准优势显著减弱,模型排名频繁逆转,表明原始全局指标在跨模型比较中存在不足。

  3. RESEARCH · CL_99613 ·

    研究提出MS-FBI以改进医学MLLM置信度校准 · arXiv论文

    一项新近发表在arXiv上的研究,探讨了多模态大语言模型(MLLMs)在医学视觉问答(VQA)场景下的置信度校准问题。研究发现,MLLMs所表达的置信度与其真实准确率常常不相关,这在医疗环境中存在风险。为解决此问题,该研究提出了一种名为多策略融合式审问(MS-FBI)的新方法,该方法结合了审问技术和专家LLM评估。实验表明,MS-FBI可将预期校准误差(ECE)平均降低40%,从而提高MLLMs在AI辅助诊断中的可靠性。

  4. RESEARCH · CL_97984 ·

    MC Dropout在脑肿瘤分割中的可靠性受到质疑

    研究人员调查了蒙特卡洛Dropout(MC Dropout)在MRI扫描中分割脑肿瘤的可靠性,发现虽然它可以将不确定性与错误对齐,但可能并不总是保证临床安全。在一项针对126名BraTS21患者的研究中,MC Dropout表现出强大的不确定性-错误对齐能力,正确地将错误体素排名更高,并识别出分割性能显著较低的亚组。然而,该研究还揭示,全局对齐指标可能会掩盖关键区域特定的校准失败,例如其中一个模型尽管整体AUROC得分很高,但在临床上…

  5. RESEARCH · CL_43559 ·

    新的损失函数提高了数据偏移下模型的置信度校准能力

    研究人员开发了一种名为期望一致性损失(ECL)的新方法,用于提高分类模型在处理协变量偏移时的置信度校准能力。该方法通过建立“期望一致性条件”来重新思考校准,该条件表明数据分布的变化并不必然导致置信度校准不准确。ECL是一种无监督域适应损失,可应用于各种校准类型,并被证明与期望校准误差(ECE)等现有方法具有相似的样本复杂度。ECL的有效性已在模拟和真实数据集上得到验证。