研究人员开发了一种名为“翻译感知污染检测”(TACD)的新方法,用于识别大型语言模型中的数据污染,特别是当污染发生在与评估基准不同的语言时。研究发现,传统的仅限英语的探测方法在模型接触到MMLU和XQuAD等评估数据集的阿拉伯语翻译时,无法有效检测到污染。TACD依赖于跨语言预测一致性,在识别此类污染方面显示出潜力,尽管其有效性因模型而异。 AI
影响 这项研究突显了LLM评估中的一个关键漏洞,并提出了一种提高跨语言基准结果可靠性的方法。
排序理由 该条目是一篇学术论文,详细介绍了一种检测LLM数据污染的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Chaymaa Abbas
- Hugging Face
- Massive Multitask Language Understanding
- Min-K%++
- Translation-Aware Contamination Detection
- TS-Guessing
- XQuAD
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →