研究人员开发了NormasTCU,一个巴西葡萄牙语信息检索(IR)的新数据集,其中包含14,469份法律文件和人工相关性判断。该研究评估了在此专业领域使用大型语言模型(LLM)作为评估者进行相关性评估的有效性。虽然LLM表现出积极的评分偏见,并且与人类判断的一致性仅为一般到中等,但它们通常能为nDCG@10和MRR等指标产生与人类评估高度相关的系统排名。 AI
影响 LLM有潜力扩展在专业、非英语领域的评估规模,提高信息检索系统评估的效率。
排序理由 该集群描述了一个新的数据集以及在一篇研究论文中对LLM在特定任务上的表现进行的评估。[lever_c_demoted from research: ic=1 ai=1.0]
在 arXiv cs.IR (Information Retrieval) 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →