Genomic Foundation Models
PulseAugur coverage of Genomic Foundation Models — every cluster mentioning Genomic Foundation Models across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新的VANDAM框架通过DNA分子先验知识增强基因组基础模型
研究人员开发了VANDAM,一个旨在通过整合DNA分子先验知识来增强基因组基础模型(GFMs)的新框架。与目前将DNA视为简单字符串的GFMs不同,VANDAM显式地建模了重要的生化、结构和物理特性。该方法利用已建立的生物物理模型来提供可在训练期间利用的先验知识。通过补充现有的基于token的目标,VANDAM在各种架构和基因组任务的下游性能方面展现出了一致的改进,并显示出对未见分子特性的泛化能力。
-
AI模型中的高增益参数是结构性的,而非机制性的
研究人员调查了文本和基因基础模型中门控前馈网络内的高增益参数。他们的分析显示,虽然这些高增益行是反复出现的架构特征,并且可以作为一种增强信号,但它们的结构重要性并不直接与功能关键性或因果组织相关联。研究发现,这些参数的机制是模型特定的,不同的模型表现出不同的因果组织。
-
基因组 AI 探针检测宏基因组数据中的生物安全威胁
研究人员开发了轻量级探针,利用 Evo 2 等基因组基础模型筛选宏基因组数据中的生物安全威胁。这些探针在冻结模型激活上进行训练,能够以高精度检测抗菌素耐药性 (AMR),其中注意力探针的 ROC-AUC 达到 0.977。该方法在识别细菌毒力方面也显示出潜力,并且能够有效地处理模拟的短读序列,为生物监测提供了一种快速且经济高效的方法。
-
新的GENEB基准旨在标准化基因组模型比较
引入了一个名为GENEB的新基准,以解决基因组基础模型比较中的挑战。该基准使用统一的协议评估了100个任务中的40个模型,结果显示总体排行榜不稳定,模型排名因任务类别而异。研究结果表明,架构选择和预训练对齐比参数数量对性能更关键。
-
JEPA-DNA 框架通过潜在语义接地增强基因组基础模型
研究人员开发了 JEPA-DNA,一个用于训练基因组基础模型的新框架。该方法将联合嵌入预测架构 (JEPA) 与现有的生成目标相结合,以改进这些模型学习生物序列的方式。通过专注于预测潜在空间中的功能表示,JEPA-DNA 增强了超越简单标记重建的语义理解。该框架在 17 项基因组基准任务上展示了最先进的性能,在线性探测和零样本评估中均显示出持续的提升。