PulseAugur
实时 10:00:08

New Chinese dataset benchmarks LLMs for knowledge-grounded tasks

研究人员推出了中文数据-文本对(CDTP),这是一个大规模数据集,旨在评估中文知识增强型大型语言模型(LLMs)。该数据集包含超过700万个实例,将中文文本与知识图谱三元组配对,旨在支持知识图谱补全(KGC)、问答(QA)和三元组到文本生成(T2T)等任务。CDTP特别解决了中文的歧义和分词模糊等语言细微差别,旨在提高LLMs的结构化推理和事实理解能力。实验表明,虽然模型规模本身不足以解决问题,但在CDTP上进行微调可以提高模型在这些知识密集型任务上的性能和鲁棒性。 AI

影响 为评估和改进中文LLMs在知识增强型任务中的表现提供了专门的基准。

排序理由 该集群描述了一个用于评估LLMs的新学术数据集和基准,已在arXiv上发布。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

New Chinese dataset benchmarks LLMs for knowledge-grounded tasks

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Chengwei Wu, Xingrui Zhuo, Mingyang Gao, Xinghe Cheng, Zhichao Yan, Jiapu Wang ·

    面向基准测试知识驱动大语言模型的超大规模中文知识图谱-文本对齐数据集

    arXiv:2510.06039v2 Announce Type: replace-cross Abstract: Reliable evaluation of knowledge-grounded Large Language Models (LLMs) in Chinese requires resources that explicitly align Chinese-language text with verifiable Knowledge Graph (KG) facts. Yet existing Chinese benchmarks p…