genomics
PulseAugur coverage of genomics — every cluster mentioning genomics across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
AI序列模型在基因组学中找到新应用
与用于语言处理的模型类似,序列模型正被应用于基因组学,以分析蛋白质和核苷酸序列。这些模型通过预测序列的掩码部分来学习进化模式,从而在无需显式标记的情况下揭示蛋白质结构和功能。然而,生物序列在字母表大小、依赖长度、缺乏清晰边界、链对称性以及重复的重要性方面与语言不同,这需要专门的模型架构和解释。
-
OpenAI报告:AI代理加速科学软件开发 · 跟踪5个来源
OpenAI发布了一份实地报告,详细介绍了AI编码代理如何在各个学科中加速科学软件的开发。报告重点介绍了八个项目,其中代理(包括OpenAI的Codex和Anthropic的Claude Code)协助完成了代码优化、打包以及移植到新语言或后端等任务。虽然代理显著提高了速度,有时将运行时间缩短了二到六倍,但对于需要专家判断、品味和细心的任务,人工监督仍然至关重要,以确保准确性并维护项目完整性。
-
基因组AI需要本地部署、零出口基础设施以实现数据主权
在敏感的基因组和生物样本库数据上运行AI需要严格的数据主权,因为基因组是永久可识别的,并且无法真正匿名化。推荐的方法是采用本地部署的AI基础设施,并实现零数据出口,同时记录每次查询的签名以确保可辩护性。外部审计师可以通过检查未中断的链条、设备和操作员的签名证明,以及确保事后没有插入、删除或更改数据来独立验证AI轨迹的完整性。
-
自然语言处理技术应用于生物序列分析的回顾
一篇最新的综述文章探讨了自然语言处理(NLP)技术在分析基因组学、转录组学和蛋白质组学等生物序列数据中的应用。文章详细介绍了从word2vec到先进的transformer和hyena operator模型等各种NLP方法如何应用于DNA、RNA和蛋白质序列分析。文章还讨论了分词策略、模型架构以及在预测蛋白质结构、基因表达和进化关系方面的最新进展。文章强调,将NLP整合到生物信息学中是理解复杂生物过程的一个有前景的方向。
-
研究论文质疑LLM在基因组学任务上的预训练成本
一篇新的研究论文评估了预训练大型语言模型(LLM)在基因组学任务上的有效性。该研究质疑了像DNABERT2这样的基于Transformer模型的显著计算成本是否能通过优于ConvNova等传统卷积模型的性能提升来证明其合理性。它还考察了预训练的贡献以及字节对编码(BPE)分词对DNA序列表示的影响。
-
FLKit工具包简化了健康科学领域联邦学习的入门流程
一款名为FLKit的新工具包已被开发出来,旨在简化联邦学习项目的入门流程,尤其是在健康和生命科学领域。这个开放的、社区维护的资源引导多学科团队完成整个联邦学习生命周期,为临床、法律、治理和技术贡献者提供特定角色的入口。FLKit围绕四个生命周期阶段构建,包含一个术语表、一个规划模板和一个工具目录,现有的FL Stories记录了多发性硬化症和基因组学等领域的项目。
-
新型双通道张量神经网络处理复杂数据
研究人员推出了一种双通道张量神经网络(DC-TNN),旨在处理张量值数据,这在神经影像学和基因组学等领域很常见。这种新网络将张量输入分解为低秩核心和稀疏精炼,并通过耦合的神经网络通道进行处理。该框架为估计建立了非渐近风险界限,并提供了一种面向结构的共形程序用于推理和结构选择,在模拟和真实数据集上展示了具有竞争力的准确性和可靠的不确定性量化。