一篇新论文探讨了不同的奖励函数(即 proper scoring rules)如何影响大型语言模型的预测能力和行为。尽管这些规则理论上鼓励诚实的概率报告,但研究发现,使用不同规则训练的模型在校准、概率使用以及偏差、信息和噪声的估计画像方面表现出差异。Brier 训练的模型在 Brier 分数和 AUC-ROC 方面表现最佳,而 log 训练的模型在 log 分数和校准误差方面表现出色,这表明奖励函数的选择不仅显著影响预测准确性,还影响预测错误的结构。 AI
影响 这项研究强调,LLM 训练目标的选择会显著改变其预测能力和错误结构,这表明在开发可靠的 AI 预测器时需要仔细考虑奖励函数。
排序理由 该项目是一篇学术论文,详细介绍了对 LLM 行为的研究。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →