一项发表在 arXiv 上的新研究发现,从大型语言模型 (LLM) 衍生的偏好判断不具有自洽性。研究人员开发了统计检验方法来衡量单一效用函数在多大程度上能够重现这些判断,发现在航班和公寓选择等各种示例中存在显著的不一致性。这表明 LLM 衍生的偏好数据不能被单一效用函数可靠地概括,这可能会影响依赖此类数据的基于代理的系统。 AI
影响 对 LLM 衍生的偏好数据在代理决策中的可靠性提出了挑战。
排序理由 发表在 arXiv 上的研究论文,详细介绍了关于 LLM 能力的发现。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- Connected Papers
- CORE Recommender
- DagsHub
- Gotit.pub
- Hugging Face
- Large Language Models
- Litmaps
- ScienceCast
- scite Smart Citations
- utility function
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →