一篇新的研究论文提出了一种通过分析大型语言模型 (LLM) 的隐含偏好来评估和引导它们的方法。该方法涉及将离散选择模型拟合到 LLM 的决策中,以恢复其潜在的成本函数。这使得能够严格评估模型的面向目标的行为、其阐述其目标的能力以及提示在使其策略与用户指定的成本函数对齐方面的有效性。该研究将此流程应用于四个医学诊断领域,发现虽然许多模型表现出一定的内部一致性,但在被指示时,它们在准确报告或采纳偏好方面存在困难。 AI
影响 这项研究为评估和控制 LLM 的行为提供了一个新颖的框架,有可能提高它们在高风险决策场景中的可靠性。
排序理由 在 arXiv 上发表的研究论文,详细介绍了 LLM 对齐和引导的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- IArxiv
- Influence Flower
- Khurram Yamin
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →