研究人员开发了一个BETA标注框架,用于构建低资源信息检索(IR)的多语言数据集。该框架利用多个大语言模型(LLMs),通过一致性和多数表决进行检查,然后进行人工评估以确保标签质量。研究还调查了通过机器翻译复用其他低资源语言的IR数据集的可行性,结果显示存在显著差异和语义保留问题,影响了跨语言数据集复用的可靠性。研究结果既揭示了大语言模型辅助低资源信息检索数据集创建的潜力和局限性,也为构建更可靠的基准提供了指导。 AI
影响 提供改进低资源语言AI模型性能的方法,可能扩大AI的可及性。
排序理由 学术论文,详细介绍了一种新的数据集构建方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →