研究人员开发了一个新的框架,使用Q方法来评估大型语言模型(LLM)与人类价值观的对齐程度。该方法包括人类和LLM将道德陈述进行强制分布排序,从而可以比较它们对价值的结构化优先级排序。研究发现,不同LLM家族之间存在显著差异,并强调即使是总体得分良好的模型也可能表现出局部错位。研究还指出,提示措辞会引入LLM响应的方差。 AI
影响 提供了一种超越简单准确性指标评估LLM伦理推理的新颖方法。
排序理由 学术论文,提出了一种评估LLM的新方法。 [lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- CORE Recommender
- DagsHub
- Gotit.pub
- Hugging Face
- large-language models
- Q methodology
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →