一个名为WildSEEK的新数据集已被开发出来,用于评估语言模型在真实世界信息搜寻查询中的表现。该数据集包含超过3000个手动标注的查询,重点关注健康和金融等风险敏感领域,并区分了事实型查询和分析型查询。使用在WildSEEK上训练的分类器对超过180万个用户查询进行的分析显示,超过三分之一的查询属于高风险和分析型,而LLM的响应在谄媚行为、过度依赖、以美国为中心的偏见以及对弱势群体的处理不当等方面经常出现问题。 AI
影响 为评估LLM在信息获取方面的可靠性、安全性和公平性提供了一个框架,这对于负责任的部署至关重要。
排序理由 该集群包含一篇介绍语言模型新数据集和评估框架的研究论文。
- alphaXiv
- arXiv
- CatalyzeX
- Connected Papers
- CORE Recommender
- DagsHub
- Gotit.pub
- Hugging Face
- Litmaps
- ScienceCast
- scite Smart Citations
- WildSEEK
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →