protein
PulseAugur coverage of protein — every cluster mentioning protein across labs, papers, and developer communities, ranked by signal.
7 天有情绪数据
-
生成式AI设计增强型蛋白质以改进DNA编辑
研究人员利用生成式AI设计了能够显著增强DNA编辑能力的新型蛋白质。其中一种AI设计的蛋白质,在整合到实验性基因编辑系统中后,在培养细胞中显示出靶向DNA插入量增加一倍的性能。这一进展凸显了AI在加速生物学研究和开发更精确的基因编辑工具方面的潜力。
-
新的LSCO方法利用AI语言模型优化蛋白质表达
研究人员开发了一种名为潜在空间密码子优化(LSCO)的新方法,以提高蛋白质表达的效率。该技术通过将序列映射到预训练的mRNA语言模型的潜在空间,将密码子选择的离散问题重塑为连续问题,从而实现基于梯度的优化。LSCO集成了表达预测器、稳定性正则化器、自然度先验和约束解码,以确保蛋白质的保真度。在抗体表达数据实验中,LSCO与现有的启发式和深度生成方法相比,表现出了优越的性能。
-
图神经网络可靠性在蛋白质功能预测中的探索
一篇新发表在arXiv上的研究论文探讨了图神经网络(GNNs)在预测蛋白质功能方面的可靠性。该研究调查了蛋白质网络中的组织特异性互作结构是否包含有助于识别不可靠预测的信息。研究人员发现,有效电阻(一种先前用于缓解GNN中过度压缩的信号)与这些网络中的度数呈强相关。虽然这种残差信号解释了在保留网络中额外的每节点损失,但其影响受到度数退化的限制,并且在选择性预测方面的改进微乎其微。
-
新方法增强了大型语言模型在长上下文和图数据上的解码能力
两篇新的研究论文介绍了一种改进大型语言模型自回归解码效率和结构感知能力的新方法,特别适用于处理长上下文和基于图的数据。CommunityKV将稀疏注意力构建为令牌图上的社区检测问题,在Qwen3和Llama-3.1模型上实现了比密集注意力高达1.71倍的生成吞吐量。GraphVQ通过使用VQ-VAE量化节点上下文和一种以对特征为条件的结构感知解码器来解决将图表示为离散令牌的挑战,提高了图生成的保真度,并在多个数据集上优于其他方法。
-
新研究通过草稿树和副本交换加速扩散模型采样 · 跟踪到2个来源
两篇新研究论文提出了加速扩散模型采样的创新方法。第一篇论文《通过投机性草稿树加速扩散采样》引入了草稿树来改进候选考虑并减少昂贵的目标评估,实现了高达8.3%的加速。第二篇论文《METALICA: METAdynamics and repLICA exchange for enhanced diffusion sampling》提出了METALICA,一种将元动力学与副本交换结合在扩散模型上的方法,以更好地采样稀有事件,例如蛋白质构象转…
-
3D打印废料转化为可食用蛋白质
研究人员正在探索一种新方法来处理3D打印产生的废料,将其转化为可食用蛋白质。初步研究结果表明,这种方法有望提高3D打印过程的可持续性。
-
人工智能开创新型蛋白质,开启新的科学前沿
人工智能正在实现创造自然界从未存在过的新型蛋白质。这一突破为科学研究和开发开辟了新的可能性。
-
研究发现上下文学习跨越多种AI模态涌现
一篇新研究论文提出了汇聚式涌现假说,认为在大型语言模型中观察到的少样本上下文学习(ICL)能力可能广泛地出现在不同的数据模态中。该研究开发了一个框架来测试这一假说,将任务应用于六种模态:语言、基因组、整数序列、时间序列、图像和蛋白质。结果表明,ICL出现在这些模态中,并且在大多数模态中显示出相关的难度剖面,在某些领域支持了该假说。
-
新框架创建亚细胞分辨率单细胞嵌入
研究人员开发了一种新颖的多模态框架来创建亚细胞分辨率单细胞嵌入。该方法整合了RNA表达谱、蛋白质序列数据和蛋白质结构信息。通过利用交叉注意力架构,该框架模拟了不同亚细胞区室内的相互作用,与以往将细胞整体处理的方法相比,提供了更精细的细胞表示。
-
Anthropic 的 Claude AI 协助蛋白质设计,但人类监督仍是关键
Anthropic 的 Claude AI 被用于一项蛋白质设计实验,但结果表明人类实验室监督对于最终结果至关重要。AI 的贡献是显著的,但蛋白质设计过程的最终成功和方向仍然由人类研究人员决定。
-
新框架提出生物科学领域人工智能的“可追溯信任”
一项名为“可追溯信任”(Traceable Trust)的新框架被提出,旨在确保人工智能在生物科学研究中的负责任使用。该框架致力于为基于人工智能输出所做的决策,特别是当这些输出指导实验室操作时,创建一个可记录和可审查的流程。“可追溯信任”解决了关于支持人工智能预测的证据、声称的能力、委托的代理权、操作授权阈值、覆盖协议以及结果如何反馈到未来决策等关键问题。该提案通过涉及生态系统资源、项目设计和直接实验室操作的案例研究进行了说明,展示了…
-
AI序列模型在基因组学中找到新应用
与用于语言处理的模型类似,序列模型正被应用于基因组学,以分析蛋白质和核苷酸序列。这些模型通过预测序列的掩码部分来学习进化模式,从而在无需显式标记的情况下揭示蛋白质结构和功能。然而,生物序列在字母表大小、依赖长度、缺乏清晰边界、链对称性以及重复的重要性方面与语言不同,这需要专门的模型架构和解释。
-
机器学习可准确分类复杂的链拓扑结构
研究人员开发了一种机器学习方法,用于分类复杂的链拓扑结构,这在聚合物熔体、DNA和蛋白质等领域具有相关性。一个在“缠绕密度矩阵”上训练的前馈神经网络在对前六个素链进行分类时达到了97%的准确率。该方法在不同温度和组件长度下保持高准确率,尽管在高斯噪声添加下准确率会下降,这表明矩阵特征对拓扑结构敏感。研究表明,在传统计算方法成本过高的情况下,机器学习是快速分类复杂链拓扑结构的可行工具。
-
新的多模态模型MKB统一科学领域,助力AI驱动的发现
研究人员推出Monkey King Bang (MKB),这是一种新颖的多模态基础模型,旨在跨不同领域进行科学发现。MKB采用共享的Transformer骨干网络,并为DNA、RNA、蛋白质、小分子、地球科学和医学图像等不同科学输入配备了专门的组件。该模型支持生物序列和气象场等原生输出,展示了其跨学科的理解和生成能力。实验表明,MKB在科学基准测试中取得了有竞争力的性能,同时保留了通用语言能力。
-
针对分子任务优化的离散扩散模型
研究人员探索了用于分子优化的离散扩散模型的设计空间,重点是如何在有限的预言机预算下适应预训练的生成模型。他们在各种分子和蛋白质任务上的研究表明,采集、奖励塑造和模型去偏对小型分子具有互补的优势。纳入回放和有效性惩罚可以进一步稳定学习,并在有效分子流形内保持探索。这种结合了采集、奖励塑造、去偏、回放和有效性控制的在线微调方法,在预言机调用和计算资源受限的情况下,表现优于离线微调和推理时搜索方法。
-
新的“Proto”语言简化了人工智能驱动的生成生物学设计
Proto是一种专为生成生物学设计的新型领域特定编程语言,它使科学家能够通过指定目标和规则来定义生物系统,而不是选择静态部分。这种方法允许AI模型自主设计复杂的生物系统,例如定制的DNA或蛋白质序列,通过协调各种专门的AI模型来完成诸如蛋白质折叠预测和序列生成等任务。该系统旨在通过减少所需的物理实验室实验次数来显著加速药物发现和个性化医疗。
-
新的攻击揭示了图神经网络的重大隐私风险
研究人员开发了两种新的生成式重建攻击:图标签条件(GLC)攻击和嵌入标签条件(ELC)攻击,以探测图神经网络(GNNs)的隐私漏洞。这些攻击利用目标模型的预测和中间表示来重建敏感的图数据,表明攻击者可以在黑盒场景下生成高质量的图。该研究还引入了一种查询要求较低但性能依然强劲的变体,突显了GNNs在各种噪声尺度下都容易遭受隐私泄露。
-
新的Python生态系统标准化生物分子序列模型
一个名为MultiMolecule的新开源Python生态系统已被开发出来,用于标准化和促进生物分子序列模型的可重用性。它提供了一个模块化框架来处理RNA、DNA和蛋白质序列模型,确保检查点保留其执行上下文。该生态系统包括标准化的组件、精选的数据集和预测管道,允许用户检查模型行为,将其适应新的分析方法,并部署具有可追溯来源的生物预测。
-
研究发现,训练后阶段对生物推理模型有关键塑造作用
一项新研究调查了不同的训练后阶段如何影响生物推理模型的性能和泛化能力。研究人员在基因组学、转录组学和蛋白质领域训练了100多个模型,改变了持续预训练(CPT)、监督微调(SFT)和强化学习(RL)等参数。研究结果表明,每个训练阶段都对泛化能力产生独特影响:CPT使模型适应生物语言,SFT在牺牲领域外泛化能力的同时提高了领域内性能,而RL应用于强大的SFT检查点时则能提高领域外能力。
-
训练后阶段对生物推理模型的泛化能力至关重要
一项对100多个生物推理模型的新研究表明,训练后阶段对模型的泛化能力有显著影响。持续的预训练使模型与生物语言保持一致,而监督微调则以牺牲领域外泛化能力为代价来提升领域内性能。强化学习可以恢复这种领域外性能,这表明训练阶段的组合,而不仅仅是更多的计算量,是有效生物推理的关键。