一篇新研究论文探讨了使用Persona条件化来评估大型语言模型(LLMs)在信息检索(IR)评估中作为相关性评估者的敏感性。通过在六个LLM骨干和两个数据集(TREC DL20和RAG24)上实例化五个不同的评估者角色,研究发现LLM的判断表现出结构化敏感性而非均匀变化。虽然高容量模型保持了系统排名的一致性,但较小模型放大了Persona引起的波动,敏感性集中在特定的检索系统上。 AI
影响 这项研究提供了一种方法来压力测试LLM评估流程,识别对评估者框架敏感的系统,并提高IR评估的可靠性。
排序理由 该集群包含一篇研究论文,详细介绍了在特定领域(信息检索)评估LLM性能的新颖方法。
在 arXiv cs.IR (Information Retrieval) 阅读 →
- DL 208
- NVIDIA Nemotron-Personas-USA
- PersonaHub
- RAG24
- TREC DL20
- umbrella
- alphaXiv
- CatalyzeX Code Finder for Papers
- DagsHub
- Gotit.pub
- Hugging Face
- Influence Flower
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →