PulseAugur
中
实时 05:42:00
实体 Confidence

Confidence

PulseAugur coverage of Confidence — every cluster mentioning Confidence across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 4 条
  1. RESEARCH · CL_200063 ·

    指令调优影响LLM的置信度和推理多样性

    一项新的研究论文调查了指令调优对大型语言模型的影响,特别考察了它如何影响模型的置信度和其生成推理的词汇多样性。研究发现,即使在预测准确性或校准方面只有微小改进的情况下,指令调优也能持续提高模型的置信度。此外,研究还观察到跨推理的多样性有所下降,并且对表面词汇多样性产生了不同影响,这表明置信度和推理多样性是指令调优的不同结果。

  2. RESEARCH · CL_203868 ·

    LLM更新可能导致回归;新研究探索预测信号

    一项新的研究论文调查了预测大型语言模型(LLM)更新何时可能导致回归(即先前正确的输出变得不正确)的方法。该研究比较了各种信号,包括置信度分数、logit边际和注意力熵,以及跨版本信号,如输出KL散度和表示漂移。研究结果表明,这些信号的有效性高度依赖于特定任务和模型更新,没有单一信号被证明具有普遍优越性。然而,即使置信度指标失效,跨版本信号仍然可以提供信息,这表明对于高风险样本,可以选择性地回退到旧模型版本。

  3. COMMENTARY · CL_99252 ·

    AI agents need durable external brains, not just large context windows

    当前在AI模型中使用大上下文窗口的方法不足以实现长期记忆,因为上下文窗口充当临时工作记忆而非持久存储。真正的AI记忆需要一个独立的、持久的系统,该系统能够跨会话存储和检索信息。这种外部大脑应为智能体设计,具备云同步、强大的搜索功能以及随时间跟踪信息来源和置信度的能力。允许自我纠正并透明地展示信息如何变化的系统对于建立对AI记忆的信任至关重要。

  4. COMMENTARY · CL_28546 ·

    作者提倡使用多重分数置信度而非单一指标

    作者反对将置信度分数折叠成一个单一数字,认为这种方法会掩盖关键细节。相反,他们建议保留多个置信度分数,以便为用户提供对系统确定性更细致的理解。这种方法旨在通过允许对系统性能进行更详细的解释来提高透明度和用户信任度。