研究人员推出了中文数据-文本对(CDTP),这是一个大规模数据集,旨在评估中文知识增强型大型语言模型(LLMs)。该数据集包含超过700万个实例,将中文文本与知识图谱三元组配对,旨在支持知识图谱补全(KGC)、问答(QA)和三元组到文本生成(T2T)等任务。CDTP特别解决了中文的歧义和分词模糊等语言细微差别,旨在提高LLMs的结构化推理和事实理解能力。实验表明,虽然模型规模本身不足以解决问题,但在CDTP上进行微调可以提高模型在这些知识密集型任务上的性能和鲁棒性。 AI
影响 为评估和改进中文LLMs在知识增强型任务中的表现提供了专门的基准。
排序理由 该集群描述了一个用于评估LLMs的新学术数据集和基准,已在arXiv上发布。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Chinese Data-Text Pair (CDTP)
- Hugging Face
- Jiapu Wang
- Knowledge Graph Completion (KGC)
- Knowledge Graph (KG)
- Large Language Models (LLMs)
- Question Answering (QA)
- Triple-to-Text Generation (T2T)
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →