entity linking
PulseAugur coverage of entity linking — every cluster mentioning entity linking across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新的知识图谱组织了15万多个研究数据集以供政策分析
研究人员开发了一个知识图谱,用于组织Harvard Dataverse中的15万多个研究数据集,并将它们与关键词、出版物和地点联系起来。该图谱识别出7,654个与政策相关的数据集,重点关注选举、立法机构和政府管理。该研究强调了地点解析的挑战,并提出人工智能驱动的元数据丰富和实体解析作为解决方案,同时指出存在偏向美国、城市级别数据的倾向。
-
掌握实体解析以获得纯净的企业知识图谱
本文讨论了企业知识图谱中数据碎片化的关键挑战,在这些碎片化中,同一个现实世界实体可以在不同系统中以不同的名称表示。它强调了诸如实体解析、链接预测和图去重等确定性方法对于确保 AI 应用程序的数据完整性的必要性。作者提出了一种基于 TypeScript 的方法,并将其与概率性 LLM 进行对比,同时强调使用 Jaro-Winkler 等字符串相似度指标进行准确的实体匹配。
-
SNAP-KG框架实现知识图谱高效流式实体集成
研究人员开发了SNAP-KG,一个旨在更高效地将新实体集成到知识图谱中的新框架。与需要为每个新实体进行重新训练的现有方法不同,SNAP-KG使用投影器将原始特征直接映射到嵌入空间,从而实现即时聚类分配。这种归纳方法显著加快了推理时间,并保持了具有竞争力的聚类质量,这在多个基准数据集和大型知识图谱上得到了证明。
-
体育AI词汇表新增“Grounding”术语
一个新术语“Grounding”已被添加到专注于体育领域人工智能的词汇表中。该词汇表旨在定义和解释与体育行业相关的人工智能概念。
-
领域特定微调增强了用于实体消歧的AI模型
一篇新的研究论文探讨了将通用文本嵌入模型应用于实体消歧任务的改编。该研究发表在arXiv上,研究了领域特定的三元组微调,以提高模型区分代表同一现实世界实体(如企业或个人)的记录的能力。通过创建具有身份保留变体的合成数据集,研究人员证明了在区分真实匹配项和高度相似的非匹配项方面取得了显著改进,这表明这种有针对性的微调方法对于数据质量管理和信息检索是有效的。
-
新论文提供了构建自助实体解析系统的实用经验
一篇新论文详细介绍了从构建自助实体解析(ER)系统中学到的实用经验。研究强调,没有单一的匹配算法能普遍有效,建议采用一个训练多种算法家族并为每个数据集选择最佳性能者的流水线。它还强调,精确率和召回率需要不同的解决方案,精确率受益于基于规则的否决,而召回率受益于多样化的候选检索。最后,该论文警告说,一个错误的正面链接可能导致不相关实体被静默合并,因此需要对跨组合并进行主动重新验证。
-
新研究探讨生物医学实体链接和基准分析
两篇新研究论文探讨了生物医学实体链接(BEL)和命名实体识别(NER)的挑战和潜在解决方案。一篇论文介绍了一个名为BeLink的系统,该系统使用指令微调的生成模型来提高BEL的效率和准确性,在链接准确性和推理时间方面均有显著提升。第二篇论文提出了一个诊断框架,以更好地理解现有的生物医学NER和EL基准测试实际衡量了什么,突出了影响评估信号和泛化需求的语料库属性的显著差异。