一个名为SciFactCheck的新基准已被开发出来,用于评估大型语言模型(LLM)在讨论科学话题时的事实性。该基准涵盖了五个科学领域,并识别了三种幻觉类型(无法验证、过度声称和归因),结果发现,专门在科学数据上进行微调的模型在事实可靠性方面表现不如通用模型。此外,当前的自动事实核查工具与专家对科学内容的判断仅有中等程度的一致性,这凸显了改进验证基础设施的必要性。 AI
影响 对当前LLM的领域特定微调方法提出了挑战,并强调了改进科学内容验证基础设施的必要性。
排序理由 该集群包含一篇详细介绍新基准和LLM评估的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- LLMs
- Raia Abu Ahmad
- ScienceCast
- SciFactCheck
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →