PulseAugur
实时 17:27:23
实体 MedMentions: A Large Biomedical Corpus Annotated with UMLS Concepts

MedMentions: A Large Biomedical Corpus Annotated with UMLS Concepts

PulseAugur coverage of MedMentions: A Large Biomedical Corpus Annotated with UMLS Concepts — every cluster mentioning MedMentions: A Large Biomedical Corpus Annotated with UMLS Concepts across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 4
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 4 条
  1. TOOL · CL_229088 ·

    新的 En-ViMedNER 语料库助力越南语生物医学 NLP 研究

    研究人员推出了 En-ViMedNER,这是首个英越平行生物医学命名实体识别 (NER) 语料库。该语料库使用统一医学语言系统 (UMLS) 语义类型进行标注,为与现有基于英语的资源进行直接比较提供了一个共享的跨语言标签空间。En-ViMedNER 包含超过 4,300 对 PubMed 摘要和近 203,000 个对齐的实体提及对,通过自动翻译、专家编辑和 LLM 辅助方法相结合构建而成。该语料库已针对越南语输入和跨语言 NER 任…

  2. TOOL · CL_56119 ·

    BioELX框架在跨语言生物医学实体链接方面达到SOTA

    研究人员开发了BioELX,一个新颖的两阶段跨语言生物医学实体链接框架,该框架不需要特定任务的标注训练数据。第一阶段通过Wikidata的多语言别名增强检索器,以改进跨语言的候选检索。第二阶段采用预训练的LLM排名器进行上下文感知消歧,同时考虑提及上下文和候选实体。实验表明,BioELX在多个基准测试中取得了新的最先进性能,尤其是在低资源语言方面。

  3. RESEARCH · CL_56332 ·

    新的多语言ColBERT模型在临床文本分析中表现出色

    研究人员开发了ClinicalEncoder26AM,一个多语言可诊断的ColBERT模型,专门用于临床和生物医学文本。该模型将token级别的语义与受BioLORD-2023启发并使用合成和标注数据增强的临床潜在空间ClinicalMap25对齐。ClinicalEncoder26AM的后训练过程利用了BGE-M3,并整合了包括合成笔记和MedMentions等标注数据集在内的各种临床资源。在MultiClinNER共享任务上进行评…

  4. TOOL · CL_21917 ·

    新框架测试GSSL在嘈杂生物医学图上的鲁棒性

    研究人员引入了一个新框架NATD-GSSL,用于评估和改进图自监督学习(GSSL)方法在应用于嘈杂的、文本派生的图时的鲁棒性。现有的GSSL技术通常假设数据是干净的,但从文本自动提取知识图会引入显著的真实世界噪声。研究发现,关系重构任务对这种噪声高度敏感,而特征重构则更具韧性。图神经网络架构的选择也会影响性能,双向消息传递设计更适合嘈杂的图。