PulseAugur
实时 08:25:51
实体 Ece

Ece

PulseAugur coverage of Ece — every cluster mentioning Ece across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 6
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 6
层级分布 · 90 天
主题
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/1 页 · 共 6 条
  1. TOOL · CL_156266 ·

    新框架使大型语言模型能够对薄弱证据进行规避式事实核查

    研究人员开发了一个名为证据链评估(ECE)的新框架,以提高大型语言模型在事实核查中的可靠性。ECE允许模型在证据薄弱或不一致时放弃做出决定,而不是强制进行二元真/假判断。这种选择性事实核查方法使用了一个工具使用验证代理,该代理从包括网络搜索和可执行检查在内的各种来源收集证据。在ECE-Bench数据集上进行测试时,ECE在已回答的声明上表现出高准确性,并能有效规避低可靠性证据的情况,起到安全机制的作用。

  2. RESEARCH · CL_133125 ·

    新的ARGTCA方法通过对属性关系进行建模来提高VLM校准 · 跟踪2个来源

    研究人员开发了ARGTCA,这是一种用于提高视觉语言模型(VLM)的可靠性和置信度估计的新颖方法。该方法利用符号属性图和图注意力网络(GAT)来捕获属性间的依赖关系,解决了先前方法将属性独立处理的局限性。实验表明,ARGTCA显著降低了预期校准误差(ECE),其中一个变体在九个基准测试中的一项提高了约37%,另一项提高了17%。

  3. TOOL · CL_117588 ·

    新流水线整合学生表现预测与元认知校准

    开发了一个名为UBP-CAP的新流水线,用于在智能辅导系统中整合学生表现预测和元认知校准。该框架通过三个模块处理学生行为遥测数据:用于正确性预测的LightGBM分类器、用于评估元认知对齐的校准指标,以及用于分解校准偏差的交叉广义线性混合效应模型。该研究引入了预测-解释散度指数(PEDI)来量化预测和解释特征剖面之间的结构性散度,研究结果表明学生的朴素ECE显著超过模型ECE,暗示存在系统性的校准不足。

  4. RESEARCH · CL_99613 ·

    研究提出MS-FBI以改进医学MLLM置信度校准 · arXiv论文

    一项新近发表在arXiv上的研究,探讨了多模态大语言模型(MLLMs)在医学视觉问答(VQA)场景下的置信度校准问题。研究发现,MLLMs所表达的置信度与其真实准确率常常不相关,这在医疗环境中存在风险。为解决此问题,该研究提出了一种名为多策略融合式审问(MS-FBI)的新方法,该方法结合了审问技术和专家LLM评估。实验表明,MS-FBI可将预期校准误差(ECE)平均降低40%,从而提高MLLMs在AI辅助诊断中的可靠性。

  5. TOOL · CL_16068 ·

    提出新指标以更好地评估AI模型校准和风险

    研究人员引入了新的指标来评估机器学习模型的校准,超越了传统的期望校准误差(ECE)。提出的校准尺寸比(CSR)指标旨在提供对过度自信风险更鲁棒的评估,而ECE可能会掩盖重大风险。此外,该论文还引入了置信度加权指标,如置信度加权准确率(cwA)和置信度加权AUC(cwAUC),以衡量分配的置信度在区分正确和不正确的预测方面的有效性。

  6. TOOL · CL_24191 ·

    新指标挑战AI置信度校准标准

    研究人员引入了新的指标来评估AI模型置信度得分的校准情况,超越了传统的预期校准误差(ECE)。提出的校准尺寸比(CSR)和置信度加权准确率(cwA)为评估过度自信风险和置信度得分的区分能力提供了更细致的评估。这些指标在合成数据和真实世界数据集上得到了验证,结果表明标准的校准方法仍然可能产生有风险的置信度分布。