Platt scaling
PulseAugur coverage of Platt scaling — every cluster mentioning Platt scaling across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
大语言模型不确定性量化研究探索校准以获得可靠答案
两篇研究论文探讨了提高大语言模型(LLM)生成答案可靠性的方法,特别是在问答任务中。第一篇论文介绍了 A-CRC-QA,这是一个事后校准框架,旨在通过将选择条件误差控制重新表述为线性期望约束来控制被接受答案中的错误率。第二篇论文实证研究了如何从词元概率中推导出数学问答的校准置信度估计,比较了单通道和多通道估计器,并评估了 Platt 缩放和等渗回归等事后校准方法。
-
IDRAAK框架使用少样本提示进行语义漂移检测
一个名为IDRAAK的新框架已被开发出来,用于检测技术需求中的语义漂移,这种漂移可能发生在翻译过程中并改变关键的数字或模态信息。该框架利用一种与语言无关的语义需求表示(SRR),并提供六种检测工作流程。研究人员发现,使用单个LLM调用的简单少样本提示方法在合成数据上达到了高精度(MCC=0.888,F1=0.983),优于更复杂的多智能体和结构化方法。对通用领域文本和对抗性释义的进一步评估突显了结构化和基于LLM的技术的互补优势,表明…
-
新的KAISEN流程增强了临床AI模型公平性审计
研究人员开发了KAISEN,一个新颖的五阶段审计流程,旨在提高临床风险模型中公平性评估的可复现性和可靠性。该流程涵盖子群分层、差异度量、机制诊断、事后缓解和漂移监控。在合成基准上的评估显示,每组阈值优化显著减少了差异,而分组Platt缩放效果有限。在代理模型错误指定下的受控场景中,机制诊断组件被证明是有效的,但在模型驱动的情况下则表现不佳。
-
新的SLC方法纠正知识追踪模型中的逐项偏差
研究人员开发了一种名为状态空间对数几率校正(SLC)的新方法,以解决已部署知识追踪模型中的逐项偏差问题。这种偏差源于架构限制和项目属性的变化,会降低预测质量。SLC通过以项目身份为条件来提高区分能力(AUC)和负对数似然(NLL),尤其有利于稀疏项目。该方法将二元观测转换为高斯伪观测,通过卡尔曼平滑器应用经验贝叶斯收缩,并拟合偏移Platt链接,在教育领域之外也显示出潜力。