Brier score
PulseAugur coverage of Brier score — every cluster mentioning Brier score across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
开源 AI 代理使用校准和外部反馈进行交易
本文详细介绍了旨在实现交易“世界模型”的开源 AI 代理系统的技术机制。该系统采用预测-行动-验证循环,并高度重视外部、可量化的反馈以进行自我纠正,而不是仅仅依赖 LLM 的内部评估。主要功能包括一个优先考虑准确性和分辨率而非原始利润的校准评分系统,一个通过要求外部验证来学习以防止自我强化错误的机制,以及强大的风险控制以防止诸如结算失败之类的交易违规行为。该平台 DuDuClaw 是开源的,允许用户为各种 AI 代理应用程序实现这些功能。
-
新的基准测试LLM-SoccerArena测试体育预测准确性
研究人员推出了LLM-SoccerArena,这是一个新颖的前瞻性实时基准测试平台,旨在评估大型语言模型(LLM)在现实世界场景(特别是体育赛事)中的预测能力。该开源平台记录了未解决事件的带时间戳的预测,并考虑了模型版本、信息访问、提示策略和预测范围等不同因素。使用2026年FIFA世界杯进行的初步评估表明,与没有网络访问的LLM相比,拥有网络访问的LLM在预测准确性方面仅有边际改善,以Brier分数衡量。
-
新基准评估金融领域AI代理的不稳定性和校准性
引入了两个新基准DFAH-Bench和FinBench,用于评估AI代理在金融决策中的表现。DFAH-Bench侧重于衡量代理可观察到的行为不稳定性,发现即使决策一致性高的模型在其工具使用轨迹中也可能表现出显著的分歧。另一方面,FinBench通过在严格的时间门控下评估概率校准和不确定性质量,以防止前视偏差,从而解决金融预测中的置信度-能力差距。这两个基准旨在为在复杂金融环境中运行的AI代理提供更鲁棒的评估方法。
-
新研究发现温度缩放无法处理软标签
一项新的研究论文挑战了温度缩放方法在模型校准方面的有效性,尤其是在处理软标签或分布性人类标签时。研究发现,假设确定性独热标签的温度缩放方法,在直接对软标签进行校准的预言机(oracle)面前表现持续不佳。这种校准差距在语言模型中比在视觉模型中更大,并且随着模型规模的增大而增加。研究结果表明,在标签模糊性固有的安全关键应用中,当前的校准方法可能无法准确反映模型的可靠性。
-
足球预测引擎 Model90 使用贝叶斯方法预测 2026 年世界杯
一位生物反应器工程师开发了 Model90,一个用于足球比赛的统计预测引擎,涵盖 2026 年 FIFA 世界杯和欧洲主要赛事。该引擎采用一个八阶段流程,结合了 Dixon-Coles 双变量泊松模型、Elo 评分和预期进球等多种统计模型,以及上下文信号。Model90 旨在实现准确的概率校准,其在世界杯前 24 场比赛中获得的 0.193 的布里尔分数(Brier score)证明了这一点,这远优于随机猜测。
-
新的奖励系统训练 AI 进行校准概率预测
研究人员开发了一种新颖的奖励机制,用于使用强化学习训练概率预测模型。这种新方法在 NFL 比赛中的胜率预测上进行了测试,旨在通过使用从过去结果派生的状态条件经验胜率来提高校准性,而不是依赖于嘈杂的单一结果奖励。该方法成功地训练了一个 7B 模型,使其校准性与博彩市场相当,并在校准性上超越了零样本前沿模型,同时保持了具有竞争力的 Brier 分数。
-
研究论文确定了脑机接口拼写准确性的关键指标
本研究论文探讨了在事件相关电位(ERP)脑机接口(BCI)中,哪些性能指标最能反映拼写速率的准确性。研究分析了两个数据集(私有的LARESI数据集和公开的OpenBMI数据集)中的13项指标,以确定它们在反映用户拼写性能方面的有效性,尤其是在ERP应用中常见的数据不平衡分布情况下。研究结果表明,Brier分数、Matthews相关系数(MCC)以及考虑类别不平衡的指标,如ROC AUC、PR AUC、AP和pAUC,最能指示拼写性能,…
-
新的ACE框架提供了更公平的大型语言模型校准比较
一个名为ACE的新框架已被开发出来,用于提供对大型语言模型校准更准确、更公平的比较。现有的使用预期校准误差和Brier分数等全局指标的方法,由于模型准确性的差异而受到混淆。ACE通过其实例对齐、分布对齐和候选对齐视图,通过控制准确性来解决这个问题。使用ACE的研究表明,在准确性控制后,许多先前观察到的校准优势显著减弱,模型排名频繁逆转,表明原始全局指标在跨模型比较中存在不足。
-
新流水线整合学生表现预测与元认知校准
开发了一个名为UBP-CAP的新流水线,用于在智能辅导系统中整合学生表现预测和元认知校准。该框架通过三个模块处理学生行为遥测数据:用于正确性预测的LightGBM分类器、用于评估元认知对齐的校准指标,以及用于分解校准偏差的交叉广义线性混合效应模型。该研究引入了预测-解释散度指数(PEDI)来量化预测和解释特征剖面之间的结构性散度,研究结果表明学生的朴素ECE显著超过模型ECE,暗示存在系统性的校准不足。
-
新三难困境证明 AI 代理无法同时做到完全有益、校准和自主
一篇新论文提出了行为可信度三难困境,证明了具有置信度门控自主性的强化学习代理在面对超出其可靠能力范围的任务时,无法同时实现最大的有益性、最佳的校准和完全的自主性。研究表明,激励校准置信度和自主行动都会导致代理在其能力较低的任务上系统性地夸大其报告的置信度。这种现象由行为扰动引理量化,论文提出了两种解决方案:承诺和领域分离。
-
研究人员发现AI监管面临校准不可能的困境
研究人员发现了一个基本挑战,即在AI代理的激励与其报告结果挂钩时,如何确保其提供真实报告。他们证明,旨在筛选代理类型的最优监管机制,会内在地造成真实报告变得次优的局面。这种“失准的内生性”阻碍了标准方法的准确评分。然而,阶跃函数的批准阈值提供了一个潜在的解决方案,通过为代理创建明确的二元选择来实现真实报告。
-
Manokhin 概率矩阵为分类器质量提供新框架
研究人员引入了 Manokhin 概率矩阵,这是一个旨在评估分类器概率预测质量的新诊断框架。该框架区分了可靠性和分辨率,将分类器分为四种原型:Eagle、Bull、Sloth 和 Mole。一项对 21 个分类器和 30 个任务进行的实证研究发现,像 CatBoost 和 Random Forest 这样的模型是 Eagles,而 XGBoost 和 LightGBM 是 Bulls,这对事后校准具有特定意义。