Prediction-powered inference
PulseAugur coverage of Prediction-powered inference — every cluster mentioning Prediction-powered inference across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
新的AI评估方法用有限数据提高准确性
研究人员开发了一种名为预测驱动平滑(PP-S)的新方法,以提高AI系统评估的准确性,尤其是在标记数据有限的情况下。这种贝叶斯方法集成了预测驱动的估计,并可以使用PP-TS跨相关领域借用强度。该系统还包括一种新颖的验证分数,可以准确估计所选平滑方法的误差,在经验测试中优于直接估计器和独立验证样本。
-
大型语言模型数字孪生:人工智能能否减少研究中的人类测量?
一篇新的研究论文探讨了基于大型语言模型的数字孪生在减少科学推理中对人类数据收集的需求方面的潜力。该研究引入了“统计可替代性”作为评估这些孪生模型是否能在没有广泛人类测量的情况下支持有效结论的标准。研究结果表明,虽然大型语言模型孪生可以复制人类的平均效应,但它们对个体差异的洞察有限,并且模型或数据的改进并不总是能节省人类数据。研究强调,人工智能生成证据的价值应通过其减少人类数量不确定性的能力来判断,而不是仅仅通过其模仿人类结果的能力。
-
通过新的校准技术提升小型语言模型的声明核查能力
研究人员开发了一种新颖的方法 NN-PPI,以提高小型语言模型 (SLM) 在声明核查价值检测方面的准确性。该技术在推理后校准模型预测,无需重新训练,显著提升了性能。NN-PPI 实现了高达 33.80% 的 F1 分数提升,使 SLM 能够以更低的计算成本匹配大型语言模型的准确性。这一进展使得大规模、准确的声明核查价值检测在经济上更加可行。
-
新的统计框架利用生成模型改进推理
研究人员推出了一种新颖的统计框架——生成式推理(GPI),旨在利用辅助生成模型来增强分布值参数上的推理。当生成模型不完美但仍能提供有价值的预测信息时,该方法特别有用。GPI将非线性 Wasserstein 空间中的复杂推理问题转化为希尔伯特空间中更易于管理的估计任务,与仅依赖标记数据的方法相比,提供了一种提高效率和鲁棒性的途径。该框架已通过模拟得到验证,并应用于 Perturb-seq 研究,以改进基因表达分布的推理。
-
新论文揭秘用于统计分析的预测驱动推断
两篇新的arXiv论文探讨了预测驱动推断(PPI)的概念,该框架使用机器学习预测来改进难以测量结果时的统计推断。第一篇论文《使用黑盒预测的最佳推断》侧重于高维高斯序列模型,描述了理论极限并开发了实用的假设检验。第二篇论文《揭秘预测驱动推断》综合了现有的PPI变体,为实践者提供了一个统一的工作流程。它强调,虽然PPI可以产生更窄的置信区间,但重复使用训练数据可能导致反保守结果,并且在某些缺失数据条件下,所有方法都可能产生有偏估计。
-
新研究量化了分布偏移下每类覆盖的成本
研究人员分析了在训练和测试数据之间发生分布偏移时,识别系统中实现有效每类覆盖的成本。他们发现,虽然分裂保形预测(split conformal prediction)能保持边际覆盖,但每类覆盖可能严重失败。该研究提出了恢复每类有效性的方法,指出每类少量目标标签就足够了,但同时实现效率和有效性需要更多的标签,其数量与类别数量和效率损失容忍度成正比。一项使用骨架动作识别的案例研究表明,仅使用源标签进行每类校准就能恢复相当一部分覆盖差距。
-
新框架通过人类受访者分配优化LLM增强调查
一篇新发表在arXiv上的研究论文介绍了一个在使用大型语言模型(LLMs)生成响应时优化调查设计的框架。该框架通过表征问题特定的“纠正难度”来解决LLM准确性可变性的挑战,并提出了一种人类受访者的最优分配规则。该方法旨在将人类标注工作导向LLM最不可靠的任务,从而在不需要人类试点数据的情况下提高整体调查效率和准确性。
-
新论文分析预测驱动推理,发现不存在普遍的“免费午餐”
一篇题为“没有免费午餐:预测驱动推理的非渐近分析”的新论文分析了预测驱动推理(PPI)策略的有效性。该研究对PPI++(PPI的一种自适应形式)进行了有限样本分析,证明了其渐近优势并非总是能在实践中得到体现。论文详细说明了PPI++在特定条件下和样本量下可能比仅使用黄金标准标签表现更差的情况,为从业者提供了评估PPI++在实际应用中效用的工具。
-
LLM 改进排名评估,引入新的可靠性方法
两篇新研究论文介绍了提高大型语言模型(LLM)在排名任务中可靠性的方法。其中一篇论文 PRECISE 使用预测驱动推理(Prediction-Powered Inference)结合人类和 LLM 的判断,减少了诸如 Precision@K 等指标的估计误差。另一篇论文 EviRank 专注于通过提取模型内部证据并根据排名位置进行校准来估计基于 LLM 的排名的置信度,解决了现有不确定性量化方法中的挑战。
-
新方法通过人工智能和人类见解提高 LLM 评估的准确性
研究人员开发了新的方法来提高大型语言模型 (LLM) 评估的准确性和校准性。一种方法是 Conformal Elo Estimation,它使用 LLM 的判断来估计 Elo 等级分,以显著更低的成本获得接近人类评级的结果。另一种方法 PRECISE 结合了少量人类标签和 LLM 判断,以纠正排名指标中的偏差,从而实现更可靠的评估并改进对表现最佳模型的识别。这些技术旨在为开发人员提供 LLM 性能的校准估计和不确定性边界,而无需大量人工标注。
-
新的MEC方法通过改进的不确定性量化来增强半监督推理
研究人员开发了一种名为机器学习辅助广义熵校准(MEC)的新方法,以改进半监督推理和不确定性量化。MEC是预测驱动推理(PPI)的一种交叉拟合、校准加权变体,它重新加权标记样本以更好地匹配目标总体,即使机器学习预测器被错误指定也能提高效率和鲁棒性。该方法在比现有PPI方法更弱的假设下实现了半参数效率界限,从而获得更准确的置信区间和覆盖范围。