PulseAugur
实时 07:43:37
实体 De Finetti

De Finetti

PulseAugur coverage of De Finetti — every cluster mentioning De Finetti across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 4
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 4 条
  1. TOOL · CL_233410 ·

    新研究发现语言模型表现出显著的概率不连贯性

    一篇新论文使用基于 de Finetti 定理的方法,探讨了语言模型所做概率预测的连贯性。研究人员发现,语言模型在其概率预测中表现出显著的不连贯性,尤其是在事件具有复杂逻辑关系或引入不相关细节时。该研究表明,当前的训练策略可能需要修订,以提高这些模型的概率连贯性。

  2. TOOL · CL_185302 ·

    AI评估方法利用决策理论进行无标签评估

    一篇新论文提出了一种使用决策理论原理来评估和正则化包括LLM在内的AI系统的方法。该方法被称为“揭示的理性”,它利用表征定理来检查AI的行为是否符合特定的理性公理。这使得无标签评估成为可能,其中AI对合成选择问题的自身响应被用来识别与一致性的偏差,并直接从这些偏差中计算惩罚。该论文概述了该方法的三个实例,借鉴了与概率一致性、偏好理性和主观预期效用相关的定理。

  3. RESEARCH · CL_145619 ·

    新理论解释 LLM Harnesses 中的相关验证器级联

    一篇新论文提出了一种用于 LLM Harnesses 中部分相关验证器级联的理论,填补了 Odds Law 留下的空白。该理论表明,对数几率在验证器门数量上是凹的,并且对于 Beta 分布的潜在变量,失败呈多项式衰减。它还确定了一个限制可靠性的盲点上限,以及一个三分类,其中门最终可以帮助、平稳或损害,具体取决于错误分布。

  4. RESEARCH · CL_95801 ·

    新统计方法量化人工智能基准不确定性

    arXiv上发表的一篇新研究论文介绍了一个用于量化人工智能基准不确定性的统计框架。该论文详细介绍了一种使用有界差分集中于无限可交换序列的方法,该方法有助于从随机子集中准确估计完整的基准分数。这种方法特别适用于复合基准,如MMLU,其中问题项在不同域之间表现出自然依赖性。