Unified Medical Language System
PulseAugur coverage of Unified Medical Language System — every cluster mentioning Unified Medical Language System across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
新的 En-ViMedNER 语料库助力越南语生物医学 NLP 研究
研究人员推出了 En-ViMedNER,这是首个英越平行生物医学命名实体识别 (NER) 语料库。该语料库使用统一医学语言系统 (UMLS) 语义类型进行标注,为与现有基于英语的资源进行直接比较提供了一个共享的跨语言标签空间。En-ViMedNER 包含超过 4,300 对 PubMed 摘要和近 203,000 个对齐的实体提及对,通过自动翻译、专家编辑和 LLM 辅助方法相结合构建而成。该语料库已针对越南语输入和跨语言 NER 任…
-
新的可审计层提高了生物医学文本分类的准确性
研究人员开发了一种新颖的可审计可靠性层,旨在通过解决大规模语料库中的伪影来提高生物医学文本分类的准确性。该系统充当面向安全的预处理模块,在不确定时避免编辑,以遵循“不造成伤害”的理念。它结合了编辑距离候选生成、n-gram评分和生物医学安全门,以保护关键术语。评估表明,该层实现了高错误修复召回率,并恢复了下游分类器中由噪声引起的性能下降的很大一部分,同时还证明了对 transformer 编码器的鲁棒性。
-
新的MTDiag数据集评估LLM在多轮临床诊断中的表现
研究人员开发了MTDiag,这是一个新的多轮诊断对话数据集,旨在更好地评估大型语言模型(LLM)在临床环境中的表现。与静态基准测试不同,MTDiag通过从DDXPlus、MIMIC-IV和AJCR病例报告中提取数据,模拟了医疗诊断的交互式和渐进式性质。该数据集使用UMLS和ICD-10等医学知识库进行标准化,并包含一个用于生成自然语言语句的管道。该计划旨在评估LLM作为诊断代理的能力,超越简单的准确性,引入临床基础的指标来评估多轮鉴别诊断。
-
新研究增强了AI在临床上忠实的医学图像字幕生成能力 · 跟踪2个来源
两篇新研究论文探讨了医学图像字幕生成方面的进展,重点是提高临床忠实度和准确性。第一篇论文引入了一个框架,通过分离训练和推理阶段来增强视觉和文本数据之间的对齐,并利用了BioMedCLIP、SigLIP2和LLaMA等模型。第二篇论文提出了一种用于训练后优化的结构化奖励系统,整合了生物医学语义和临床图一致性,以提高生成字幕的事实性和相关性。
-
Databricks通过AI Classify和向量搜索增强文档分类能力
Databricks开发了一种新颖的文档分类方法,能够处理拥有超过10万个标签的分类体系,克服了现有方法的局限性。他们的解决方案结合了向量搜索和Databricks AI Classify函数,首先检索潜在标签的短名单,然后使用AI Classify从缩减的集合中选择最合适的标签。与直接调用前沿模型相比,该方法在三个基准用例中表现出更高的准确性和显著更低的成本。
-
新框架将医疗器械批准与专利相关联
研究人员开发了一个名为Bridge-MedDevKG的新框架,用于将FDA批准的心血管器械与其相应的专利进行链接。由于以临床结果为中心的FDA文件与技术性专利描述之间存在显著的语义差异,这项任务具有挑战性。所提出的解决方案整合了领域特定的本体(MedDevOnto)与UMLS标准化、多信号候选生成以及使用XGBoost进行异构重排序,以实现高召回率和降噪。由此产生的MedDevKG提供了数百万个高置信度的链接,从而能够更好地整合医疗器…
-
新基准推动医学视觉语言模型在患者沟通和结构化报告方面的进展
研究人员开发了两个新的医学视觉语言模型(Med-VLMs)基准。MedLayBench-V 专注于将专家医学术语与通俗语言对齐,使用结构化概念基础细化管道和 UMLS CUIs 来确保语义准确性。另一方面,HiPath 是一个用于结构化病理报告预测的框架,利用分层模块进行视觉编码、跨模态对齐和诊断生成,在中国真实医疗数据上实现了高准确率和安全性。
-
新的T2D-Bench框架评估LLM在2型糖尿病方面的准确性
研究人员开发了T2D-Bench,一个旨在评估大型语言模型(LLM)在2型糖尿病管理方面的准确性和循证推理能力的新评估框架。该框架利用一个多层知识图谱,整合了临床指南和生活方式因素,以检查LLM输出是否符合证据要求。初步测试表明,当前的LLM,如GPT-4o-mini和GPT-4o,在相当大比例的案例中未能通过这些循证检查,凸显了此类严格评估方法对于确保可靠临床建议的必要性。
-
新基准揭示医疗AI检索在多语言方面存在严重缺陷
研究人员推出了MMed-Bench-IR,一个旨在评估多语言医疗信息检索能力的新基准。该基准通过评估六种语言的跨语言对齐、概念区分和证据检索能力,解决了现有工具的局限性。使用MMed-Bench-IR进行的评估显示,与仅限英语的性能相比,多语言环境下的性能显著下降,这凸显了当前生物医学编码器存在的关键差距。
-
新的DeFAb基准揭示基础模型在可废止归纳推理方面存在困难
研究人员开发了DeFAb,一个旨在严格评估基础模型可废止归纳推理能力的新基准。该基准将广泛的知识库转换为形式上可靠的实例,要求模型构建能够解释异常的假设,同时覆盖默认值并保留其他预期。与之前的评估不同,DeFAb强制执行逻辑严谨性,确保假设的推导是正确、保守和最小化的。在DeFAb上测试的前沿模型显示出明显的局限性,在某些层级的准确率下降到低至7.8%,表明其在复杂的理论推理和理论修正方面存在困难。
-
新研究统一了知识图谱补全(KGC)的解释,并解决了图探索的挑战
研究人员正在探索知识图谱补全(KGC)和探索的新方法。一篇论文提出了一个统一的后验解释分类法,以提高 KGC 的可复现性和评估性。另一篇论文介绍了模型图归纳学习(MGIL),以捕捉全局图结构,实现更准确的链接预测。此外,一项研究确定了阻碍非专业用户与不熟悉知识图谱交互的“初始探索问题”(IEP),并提出了新的界面设计。最后,提出了 TRACE-KG 框架,用于上下文丰富的知识图谱生成,绕过了预定义的模式。
-
LongBEL框架通过文档上下文改进生物医学实体链接
研究人员开发了LongBEL,一个考虑整个文档上下文而非仅单个提及或句子的生物医学实体链接新框架。该方法旨在通过识别文档内提及之间的依赖关系并减少级联错误来提高一致性。LongBEL的有效性在五项多语言生物医学基准测试中得到证明,与现有的句子级方法相比,在处理重复概念方面显示出显著的改进。
-
新框架测试GSSL在嘈杂生物医学图上的鲁棒性
研究人员引入了一个新框架NATD-GSSL,用于评估和改进图自监督学习(GSSL)方法在应用于嘈杂的、文本派生的图时的鲁棒性。现有的GSSL技术通常假设数据是干净的,但从文本自动提取知识图会引入显著的真实世界噪声。研究发现,关系重构任务对这种噪声高度敏感,而特征重构则更具韧性。图神经网络架构的选择也会影响性能,双向消息传递设计更适合嘈杂的图。