Domain-Specific Language Model Pretraining for Biomedical Natural Language Processing
PulseAugur coverage of Domain-Specific Language Model Pretraining for Biomedical Natural Language Processing — every cluster mentioning Domain-Specific Language Model Pretraining for Biomedical Natural Language Processing across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
新的视觉语言模型统一大脑白质分析
研究人员开发了TractoGraphVLM,一个新颖的视觉语言框架,专为大脑白质示踪设计。该统一模型在共享的GPS架构内处理四个不同的任务:束分类、文本到束检索、解剖描述和视觉问答。通过将纤维束表示为图并使用对比学习将其与BiomedBERT文本编码器对齐,TractoGraphVLM在分类和检索任务上表现出色,并有可能实现对不同受试者群体的零样本迁移。
-
新框架SCEPTER综合医学文献以提供临床建议
研究人员开发了SCEPTER,一个旨在通过将复杂的病例描述转化为可操作的建议来简化循证临床决策的新框架。SCEPTER集成了PubMed检索、语义排序、基于LLM的声明提取和多目标推理,将大量的科学文献合成为一套可管理的循证见解。评估表明,SCEPTER可以将平均576篇论文减少到仅53篇,同时保持证据多样性并提高建议效用,与传统的排序方法相比。
-
研究:评估设计影响MeSH特征性能差距
一篇新发表在arXiv上的研究论文,调查了评估设计对专家分配和自动生成的医学主题词(MeSH)在用作分类任务特征时的性能差距的影响。该研究在Cohen药物类别识别基准上,比较了词袋逻辑回归模型和领域特定语言模型BiomedBERT。研究结果表明,专家分配和自动分配MeSH之间的差距会因评估方法(如语料库大小和交叉验证折叠)而显著不同。研究还指出,像BiomedBERT这样的Transformer模型在处理附加的MeSH术语时可能面临令…
-
Canopy模型通过异构图基础模型推进代谢工程
研究人员推出Canopy,这是一种新颖的异构图基础模型,专为代谢工程设计。该模型将基因、蛋白质、代谢物和实验结果等多样化数据源整合到统一的知识图中。Canopy利用ESM-2(用于蛋白质序列)和MoLFormer(用于化学结构)等领域特定基础模型来创建多模态表示。在应用于发酵滴度预测时,Canopy嵌入的性能显著优于传统的表格机器学习方法。
-
AI 模型在预测癌症 TNM 分期方面表现不一
CaresAI 的研究人员开发了用于预测癌症 TNM 分期的模型,这是诊断和治疗该疾病的关键组成部分。该研究探索了各种机器学习技术,包括 ClinicalBERT、BioBERT 和 PubMedBERT 等深度学习模型,以及逻辑回归和 LightGBM 等传统方法。尽管模型在训练期间表现出有希望的结果,特别是使用 TF-IDF 特征的 LightGBM,但它们在测试集上的性能有所下降,这表明在临床文档中存在泛化能力和类别不平衡方面的挑战。
-
AI模型高精度检测临床试验剂量错误 · 已追踪2个来源
研究人员开发了一种使用领域特定Transformer嵌入和分类模型来检测临床试验中剂量错误的方法。该研究评估了几种语言模型,包括ClinicalBERT、PubMedBERT、BioBERT和MedCPT,用于编码文本试验数据。BioBERT表现出卓越的性能,ROC-AUC达到0.794,比ClinicalBERT提高了3.95%。组合多个嵌入并未增强结果,这表明领域对齐比表示堆叠更关键。预测剂量错误最有效的模型是梯度提升、支持向量分…
-
新的BERT模型增强了医疗器械召回分诊能力
研究人员开发了RecallRisk-BERT,一个旨在改进医疗器械召回分诊和评估的新型多任务框架。该模型整合了召回叙述中的文本数据以及产品代码和法规编号等结构化特征,以同时预测召回的严重程度和根本原因类别。该框架使用PubMedBERT进行文本表示,并将其与其他嵌入相结合,与单任务模型相比表现出优越的性能,并与观察到的根本原因严重程度模式显示出很强的一致性。
-
新方法改进大型行为模型中的因果发现
研究人员开发了一种方法,通过解决嵌入邻近性问题来提高大型行为模型(LBM)中因果发现的准确性。标准的生物医学语言模型会错误地关联不相关的概念,导致 LBM 推断出错误的因果联系。提出的修复方法采用对比学习方法,利用知识图谱挖掘困难的负样本,显著改善了相关概念和不相关概念之间的分离。该方法还包括使用 OpenVINO 在 Intel 硬件上进行更快推理的优化。
-
新的PubMedCausal语料库增强了生物医学因果关系抽取
研究人员推出了PubMedCausal,一个用于生物医学文本因果关系抽取的新语料库。该数据集源自PubMed摘要,提供了3,945个因果关系行和6,491个因果对的跨度级标注,能够对模型能力进行详细评估。基准测试表明,虽然像PubMedBERT这样的生物医学编码器在因果检测方面表现强劲,但像DeepSeek-R1-32B这样的生成模型在少样本提示下进行跨度级抽取时也能取得有竞争力的结果。
-
新数据集从Reddit提取药物洞察
研究人员开发了ReDose,一个包含6,435个关于物质使用的Reddit帖子的数据集,以帮助医生更好地了解临床过量病例之外的真实世界药物使用情况。该数据集由一位毒理学家和医学生标注,包含DRUG、DOSE和EFFECT等实体。在对各种模型进行基准测试时,BiomedBERT在DRUG实体提取方面表现强劲,而Llama-3 70B在整体提取方面优于GPT-4。该研究强调了从用户生成内容中准确提取EFFECT实体的持续挑战。