研究人员开发了一种新方法,用于审计大型语言模型 (LLM) 在其连续输出概率被隐藏时的校准情况。通过操纵 logit_bias 参数,每个样本的单次查询可用于评估精确的概率阈值。该技术为二元任务引入了一种新颖且一致的真实校准误差估计器,为审计黑盒基础模型提供了一个高效的框架。 AI
影响 通过提供一种即使在内部概率被隐藏时也能审计校准的方法,从而能够对 LLM 进行更鲁棒的安全评估。
排序理由 该集群包含一篇研究论文,详细介绍了一种审计 LLM 校准的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- IArxiv
- large-language models
- ScienceCast
- True Calibration Error
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →