Protein Language Models
PulseAugur coverage of Protein Language Models — every cluster mentioning Protein Language Models across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
轻量级 Murmur2Vec 嵌入在生物分类中可媲美大型 PLM
研究人员开发了 Murmur2Vec,一种用于生物序列分类的轻量级高效嵌入方法,其性能可与 ESM-2 等大型、计算密集型蛋白质语言模型 (PLM) 相媲美。这种新方法使用哈希草图来聚合 k-mer 计数,提供了一种理论上可靠的替代方案,适用于在普通硬件上进行大规模基因组监测。在包括 SARS-CoV-2 刺突蛋白谱系和 HIV-1 亚型在内的四项分类任务的比较测试中,Murmur2Vec 的表现与微调后的 ESM-2 模型相当或更优…
-
新方法使用几何学来解释蛋白质语言模型特征
研究人员开发了一种新方法,通过使用蛋白质骨架的几何注释来解释蛋白质语言模型(pLMs)中的潜在特征。这种方法应用于ESM-2模型,揭示了局部几何形状与模型许多特征显著相关,比以前的数据库或基于序列的注释方法提供了更详细的理解。这些发现有助于区分具有相似数据库注释的特征,并为未注释的宏基因组蛋白质序列提供见解,而消融实验证明了几何特征对接触预测的影响。
-
新方法解释蛋白质语言模型嵌入以进行适应性预测
研究人员开发了一种新颖的方法,使用正交投影来解释蛋白质语言模型(PLMs)生成的嵌入。该技术旨在识别这些嵌入中编码了哪些生化特性,这对于蛋白质适应性预测等任务至关重要。通过消除已知表格特征的影响,该研究表明 PLM 嵌入捕获了与这些生化特性相关的模式,并量化了它们对预测准确性的贡献。
-
蛋白质语言模型中发现新的“离流形坍塌”问题
研究人员在引导式蛋白质语言模型中发现了一个关键问题,称为“离流形坍塌”。当模型的内部表示退化到与随机输入无法区分的状态时,就会发生这种现象,即使外部评分系统仍可能认为生成的序列是成功的。这种坍塌可能导致序列在结构上不合理或复杂度低。为了解决这个问题,开发了一种新的事后过滤方法,称为马氏距离过滤。该技术利用自然蛋白质激活的密度先验来识别和保留典型的候选者,从而在不改变生成过程的情况下提高属性分数和结构合理性。
-
蛋白质语言模型信息在不同层级的分布被揭示
一项对13种蛋白质语言模型(PLMs)在15个下游任务上的新研究表明,这些模型的最终层并不总是包含对优化性能最具信息量的嵌入。研究人员发现,用于预测任务的相关信息根据任务和数据集的不同,分布在不同的层级中。例如,对于包含深度突变扫描数据的模型,浅层更有效;而对于多样化的天然蛋白质数据集,深层则更好。研究还指出,当任务涉及人工蛋白质时,性能会显著下降。
-
新的基于偏好的学习框架增强抗体设计
研究人员开发了一种新颖的基于偏好的学习框架,以改进抗体表达排名,这是抗体设计中的关键步骤。该方法利用稀缺的定量表达数据以及来自免疫数据的海量弱阳性监督数据。通过调整用于蛋白质语言模型的Direct Preference Optimization (DPO)并结合基于IMGT的对齐,该框架可以高效地在可变长度序列上进行训练。在大量内部数据集上的评估表明,该方法始终优于现有基线,为数据受限场景下优化抗体可表达性提供了可扩展的解决方案。
-
蛋白质语言模型的过敏原解释缺乏生物学依据
一项新近发表在arXiv上的研究质疑了用于过敏原性分类的蛋白质语言模型所提供的解释的生物学相关性。尽管ESM-2和DeepPlantAllergy等模型在蛋白质级别的预测准确性方面表现出色,但它们的残基级归因信号与注释的过敏原表位没有显著的关联。研究表明,这些模型可能依赖于一般的序列特征,而不是特定的免疫学机制,并警告说,在没有严格验证的情况下,不应将它们的解释视为用于安全筛选或低过敏原设计的直接免疫学见解。
-
新方法可在无人反馈的情况下引导蛋白质模型 · 跟踪 2 个来源
研究人员开发了一种名为无监督奖励优化(unsupervised reward optimization)的新框架,用于蛋白质语言模型(PLMs)。该方法无需昂贵的湿式实验室验证或精选的偏好数据集,即可实现可控的蛋白质生成。该方法利用源自模型不确定性和语义一致性的任务无关奖励,在实验中优于 DPO 和 KTO 等现有方法。该框架提供了一种利用其自身生成数据改进 PLMs 的可扩展方法,尤其是在标记反馈稀缺时非常有用。
-
SurfDesign框架利用表面几何学推进蛋白质设计
研究人员开发了SurfDesign,一个专注于分子表面几何学和理化性质的新蛋白质设计框架。该方法将表面的连续几何流形建模与蛋白质语言模型相结合。据报道,SurfDesign在设计新型结合蛋白和酶方面优于现有的表面条件和仅骨架方法,并且在逆向折叠任务中也表现强劲。
-
新型蛋白质语言模型增强分子动力学和设计
研究人员正在开发先进的蛋白质语言模型(pLMs),以改进分子动力学模拟和蛋白质设计。一种名为 PLaTITO 的方法整合了蛋白质语言模型嵌入,以增强可转移隐式转移算子在分子动力学中的泛化能力,在分布外蛋白质系统上表现出最先进的性能。另一个模型 HD-Prot 在混合扩散框架内使用连续结构令牌来联合建模蛋白质序列和结构,以更少的计算资源实现了具有竞争力的结果。此外,一项研究正在探索 PLMs 的内部表示,分析它们如何编码结构特征,并确定…
-
蛋白质语言模型使用专门的机制来检测序列重复
研究人员调查了蛋白质语言模型(PLMs)如何识别蛋白质序列中的重复片段。他们的发现表明,PLMs首先使用通用的位置注意力机制和生物学特异性组件(例如编码氨基酸相似性的神经元)来创建特征表示。随后,归纳头(induction heads)专注于这些重复片段中对齐的标记(tokens)以预测正确答案。这种近似重复的检测机制有效地包含了精确重复的检测,展示了PLMs如何将基于语言的模式匹配与专门的生物学知识相结合。
-
ProteinOPD框架将蛋白质设计对齐速度提升8倍
研究人员开发了ProteinOPD,这是一个用于将蛋白质语言模型(PLMs)与期望功能对齐的新框架。该方法将预训练的PLMs适配成专门的教师模型,并使用一种称为On-Policy Distillation的技术将其知识蒸馏到一个学生模型中。ProteinOPD旨在平衡多个目标,同时不牺牲模型固有的可设计性,据报道,与强化学习替代方案相比,其训练速度提高了8倍。