两篇新研究论文探讨了AI偏好推理和决策的细微差别。第一篇论文《可验证、可阐述和默会偏好组成部分》(Verifiable, Articulable, and Tacit Components of Preference)介绍了一个名为CreativePreferences的大型数据集,并强调了AI模型能够阐述或验证的内容与人类默会理解之间存在的显著差距。第二篇论文《询问、放松还是行动?评估LLM偏好推理中的可操作不确定性》(Ask, Relax, or Act? Evaluating Actionable Indeterminacy in LLM Preference Reasoning)正式定义了“可操作不确定性”,并提出了一个评估LLM代理如何处理不确定性的基准,发现模型常常难以识别何时无需干预。 AI
影响 这些研究突出了AI对齐和决策方面需要改进的关键领域,表明需要开发能够更好地理解人类默会偏好并在不确定情况下更明智地采取行动的模型。
排序理由 两篇在arXiv上发表的关于AI偏好推理和决策的学术论文。
- Alexander Spangher
- alphaXiv
- arXiv
- CatalyzeX
- Collins
- CreativePreferences
- DagsHub
- Goodhart's law
- Gotit.pub
- Hugging Face
- reinforcement learning from AI feedback
- RLVR
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →