PulseAugur
中
实时 11:02:18
实体 AUARC

AUARC

PulseAugur coverage of AUARC — every cluster mentioning AUARC across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 3
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_185371 ·

    新论文发现LLM置信度估计受稀疏性影响存在缺陷

    一篇新发表在arXiv上的研究论文强调了大型语言模型(LLMs)在分类任务中估计置信度时存在的重大局限性。研究发现,像语言化这样的常用方法会产生过于稀疏的输出,像Qwen3-32B这样的模型只提供很少的独特置信度值。这种稀疏性严重影响了评估指标,并根据插值选择改变了模型排名。研究人员提出了一种名为‘语言化对数概率’(verbalization logprobs)的新方法,该方法在不增加推理成本的情况下解决了稀疏性问题并改进了置信度估计。

  2. TOOL · CL_190046 ·

    LLM 置信度估计在分类任务中存在稀疏性问题,影响评估效果

    一篇新论文指出了大型语言模型(LLM)在分类任务中估计置信度时存在的重大局限性。研究人员发现,常见的诸如语言化(verbalization)等方法会导致置信度输出高度稀疏,模型通常只产生少数几个不同的置信度值。这种稀疏性严重影响了准确率-拒绝曲线下面积(AUARC)等评估指标,因为不同的插值方法可能导致模型排名发生巨大变化。该论文提出了一种新方法,“语言化对数概率”(verbalization logprobs),该方法通过词元(to…

  3. TOOL · CL_154071 ·

    新的LLM不确定性框架模拟逻辑关系

    研究人员推出了一种名为逻辑图不确定性(LGU)的新型框架,旨在改进大型语言模型(LLM)量化其不确定性的方式。与现有的侧重于语义等价性的方法不同,LGU显式地模拟了不同生成答案之间的逻辑关系,例如蕴含和不相容。这种方法旨在减少当响应在逻辑上一致但形式不同时,不确定性的高估和幻觉的错误标记。在对几个问答基准的评估中,LGU在不确定性估计方面表现出色,在AUROC和AUARC方面分别优于语义熵基线高达7.1%和3.5%。