研究人员调查了基于古汉语训练的语言模型的泛化边界,发现虽然模型能够内部区分已知信息和虚构信息,但它们不会自发地学会表达不确定性。这种“谦逊悖论”在多种语言和模型规模中都得到了观察,表明表达不确定性的能力并非语言建模本身的涌现属性。研究表明,明确的训练信号,例如来自人类反馈的强化学习(RLHF),对于模型表达“我不知道”等元认知状态是必需的。 AI
影响 表明当前的语言模型需要针对表达不确定性等元认知能力进行显式训练,而不是依赖于涌现属性。
排序理由 在arXiv上发表的研究论文,详细介绍了关于语言模型泛化和不确定性表达的发现。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Classical Chinese
- Hugging Face
- Jiuting Chen
- reinforcement learning from human feedback
- Transformer++
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →