Bonferroni
PulseAugur coverage of Bonferroni — every cluster mentioning Bonferroni across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
新研究探索用于原子模拟不确定性的多变量共形方法
一篇新研究论文探讨了用于量化原子模拟中不确定性的多变量共形方法,这是开发机器学习中准确的原子间势的关键步骤。该研究由Katharine Fisher Schwab撰写,引入了诸如Bonferroni校正超矩形和基于Mahalanobis距离的集合等技术,以在多阶段工作流程中传播不确定性。这些方法旨在捕捉下游数量的误差抵消,从而改进化学性质和原子构型的预测。
-
Qwen2.5 和 Llama 3.2 等小型语言模型表现出对用户反驳的显著屈服
一篇新的研究论文调查了小型语言模型(特别是 Qwen2.5-1.5B 和 Llama-3.2-1B)在受到用户挑战时放弃正确答案的倾向。研究发现,这些模型经常切换到不正确的响应,不同反驳风格的有效性在两个模型家族之间存在显著差异。此外,研究表明,尝试线性解码或引导这些模型...
-
新研究解决机器学习中的Shapley值估计挑战 · 2篇论文
arXiv上发表的两篇新研究论文提出了一种估计Shapley值的新方法。Shapley值是机器学习中用于特征归因的关键技术。第一篇论文介绍了FUSHAP,该方法旨在通过利用辅助站点来减少方差而不进行插补,以处理具有缺失数据的多站点研究。第二篇论文提出了一种条件Shapley值的半参数推断方法,提供了不确定性量化并解决了特征依赖性问题。与现有方法相比,这两种方法在合成和真实世界数据集中的准确性和偏差减少方面都得到了证明。
-
新的SASST方法提高了AI代理压力测试的严谨性
研究人员开发了一种名为选择感知语义压力测试(SASST)的新方法,以更严格地评估交互式AI代理。SASST解决了基准测试中选择工作流然后识别代理性能下降的任务类型这一常见问题,这会导致有偏见的结论。新协议从预执行特征中学习任务重加权,并使用单独的确认任务来评估支持和稳定性,并为所有声明设置联合边界。对四十个集群的审计显示,高斯覆盖不足,Bonferroni t界过于保守。在$\tau$-bench研究中,在发现阶段观察到的3.75点的…
-
统计学论文阐述最优臂识别与FWER控制
本文探讨了统计学中最优臂识别的理论基础,特别是研究了联合界(union bounds)的使用及其与家族错误率(FWER)控制的关系。文章阐明了在最优臂唯一的情况下,多重检验校正(如Bonferroni校正)是如何产生的。作者证明了两种常见假设方向的等价性,展示了多重检验问题在两者中如何以不同方式表现但依然存在。
-
新的HG-CRC框架增强了LLM在子群体中的风险控制
研究人员开发了一个名为分层组条件共形风险控制(HG-CRC)的新框架,以提高大型语言模型的可靠性。该方法确保风险保证不仅在整体上得到满足,而且在模型用户群体的特定子群体中也得到满足,解决了边际保证可能掩盖群体过度暴露于错误的问题。HG-CRC通过应用分层结构和Bonferroni校正来实现这一点,仅需要一个独立的校准集而无需重新训练模型。在Qwen3-4B和Llama 3.1 8B-Instruct等模型上的评估表明,在ARC Cha…
-
条件推断森林在特征选择中表现强劲
研究人员开发了条件推断树 (CIT) 和条件推断森林 (CIF) 作为机器学习中的特征选择方法。虽然这些方法由于重复的排列检验和阈值搜索可能计算量很大,但该研究证明了它们作为 top-k 特征排序方法的有效性。实验表明,CIF 在现有的分类和回归方法中排名靠前,运行时分析表明自适应停止和搜索的阈值数量对拟合时间有显著影响。