研究人员开发了一种名为强化犹豫(RH)的新训练方法,通过教会语言模型在不确定时放弃回答,使其更加值得信赖。与奖励任何回答的传统方法不同,RH使用三元奖励,对错误回答的惩罚比弃权更严重。在逻辑谜题、医学问题和高等数学问题上的实验表明,RH能有效训练模型校准其诚实度,不同的惩罚级别可以产生针对不同风险容忍度的优化模型。该研究还引入了级联和自级联等推理策略,利用弃权作为协调信号,以更低的计算成本优于多数投票。 AI
影响 这项研究通过使AI系统能够准确地发出不确定信号,减少了在关键应用中幻觉的影响,有望带来更可靠、更值得信赖的AI系统。
排序理由 介绍语言模型新颖训练方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- CatalyzeX Code Finder for Papers
- DagsHub
- Gotit.pub
- GPQA: A Graduate-Level Google-Proof Q&A Benchmark
- GSM8K
- Honesty over Accuracy: Trustworthy Language Models through Reinforced Hesitation
- Hugging Face
- MATH Levels 4--5
- MedQA
- Mohamad Amin Mohamadi
- Reinforced Hesitation
- Reinforcement Learning from Verifiable Rewards
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →