Smiles
PulseAugur coverage of Smiles — every cluster mentioning Smiles across labs, papers, and developer communities, ranked by signal.
6 天有情绪数据
-
新的VLSR框架通过本地化增强LLM分子推理能力
研究人员开发了视觉潜在结构推理(VLSR)框架,旨在改进大型语言模型(LLM)理解分子结构和预测其性质的方式。与直接处理分子图像或使用SMILES等文本表示的先前方法不同,VLSR首先识别分子图像中化学上重要的区域。然后,它利用这些局部区域在潜在空间中进行推理,从而实现更专注、更高效的分析。据报道,与基于文本的推理基线相比,该方法实现了9.6倍的更高吞吐量。
-
新型分子大语言模型使用子结构推理以改进属性预测
研究人员开发了MR-MoL,这是一种新颖的分子大语言模型(LLM),用于药物发现中的属性预测。与现有隐式表示分子的模型不同,MR-MoL显式地将子结构归因作为推理。这种推理源自微调的图神经网络,通过突出显示不同粒度(如Murcko骨架、BRICS片段和官能团)的影响分子成分来指导LLM。该模型在八项MoleculeNet任务上表现出色,优于通用模型,并缩小了与专用模型的差距,同时诊断证实了其有效利用了提供的推理。
-
MolBioKG 系统将未注册分子置于生物医学知识图谱中
研究人员开发了 MolBioKG,一个旨在将未注册分子连接到生物医学知识图谱的新型两层系统。该系统通过使用多分辨率结构锚定将未见过的分子置于现有的生物医学证据中,解决了“图外分子”的挑战。MolBioKG 仅使用 SMILES 字符串即可检索结构相关的图实体并遍历其生物医学邻域,在多跳推理和图外目标召回等任务中表现优于现有方法。
-
MinerU.Chem系统在化学结构识别方面达到93%的准确率
一个名为MinerU.Chem的新系统已被开发出来,用于从有机化学文档中提取化学结构和反应,并将其转换为机器可读的数据。该系统集成到MinerU平台中,使用一种称为CARBON的核心表示来保留视觉布局和化学语义。在评估中,MinerU.Chem在识别分子结构方面达到了93.02%的准确率,在MolRecBench-Wild数据集上,其性能比GPT 5.6 "Sol"高出18个百分点以上。
-
新模型CheMatE统一化学结构和自然语言
研究人员开发了CheMatE,这是一种新的嵌入模型,旨在统一空间中联合表示化学结构(SMILES)和自然语言。CheMatE基于ModernBERT骨干构建,采用两阶段训练过程:在大量科学文档语料库上继续进行掩码语言建模,随后与算法生成的SMILES-文本对进行对比学习。这种方法旨在防止对化学语法过度拟合,并保留基础语义能力,在分子性质预测和科学语言理解任务中展现出稳健且可迁移的表示。
-
新的SIGMA目标改进了分子自回归模型
研究人员开发了SIGMA,一种用于自回归分子模型的新型目标函数,它提高了模型在不考虑序列化格式的情况下为分子分配概率的能力。该方法使用具有化学认证的相同后缀三元组的密集后缀位置目标来对齐隐藏状态并减少不一致的下一个标记决策。SIGMA已在各种数据集和表示中证明了Frechet ChemNet距离的降低,并提高了分子属性基准的平均预测性能。
-
新的生成模型InVirtuoGen推动了基于片段的药物发现
研究人员开发了InVirtuoGen,这是一种新颖的离散流生成模型,专为基于片段的药物发现而设计。该模型将生成范式从完成转向精炼,从而能够更有效地从头生成分子和优化属性。与现有方法相比,InVirtuoGen在实际分子优化基准测试中表现出卓越的性能,并在先导优化中获得了更高的对接分数。该项目通过发布预训练的检查点和代码以实现可重复性,强调了开放科学。
-
新的 Python 库连接分子机器学习与 scikit-learn
一个名为 scikit-fingerprints 的新 Python 库已发布,旨在将分子机器学习功能与 scikit-learn 生态系统集成。该库基于 RDKit 构建,为分子指纹、相似性度量和数据拆分策略提供了一个统一的接口,旨在简化分子机器学习工作流程的原型设计、复现和部署。目标是使这些化学信息学工具更容易获得,并与更广泛的 Python 机器学习领域兼容。
-
新的 Q-Steer 方法提升了 AI 语言模型的分子优化能力
研究人员推出了一种名为 Q-Steer 的新方法,旨在增强语言模型的分子策略优化能力。该技术通过估计中间动作的下游奖励来解决分子生成中延迟反馈的挑战。Q-Steer 包含一个冻结的前缀动作价值评分器 PAVS-Q,它在生成过程中向采样 logits 添加了一个归一化的价值奖励。在 PMO23 数据集上的实验表明,在固定的在线 Oracle 预算内,Q-Steer 在各种分子语言模型骨干和优化器上持续提高了平均有效唯一分数,优于基线方法。
-
OLEDLM:用于OLED分子设计的新型语言模型
研究人员开发了OLEDLM,一个专门为有机发光二极管(OLED)分子设计而设计的创新语言模型。该模型利用LLaMA风格的Transformer架构作为基础化学语言模型,然后使用基于BERT的属性预测器和强化学习进行微调。该框架旨在通过密度泛函理论验证,高效生成具有所需光电特性的OLED SMILES序列。
-
S1-Omni模型统一科学AI任务,性能超越GPT-5.5和Gemini-3.1 Pro
研究人员推出S1-Omni,这是一种新颖的统一多模态推理模型,旨在推进科学人工智能(AI4S)。该模型通过将多种数据类型、科学定律和专家知识的联合建模整合到一个单一框架中,解决了当前AI4S方法的碎片化问题。S1-Omni将文本、化学结构和图像等各种科学输入映射到共享表示空间,结合科学定律进行基于证据的推理,并执行特定任务的解码,以实现属性预测和蛋白质结构分析等应用。S1-Omni在一个涵盖200个科学任务的大型语料库上进行了训练,据…
-
新框架 MolBasic 通过 SMILES-图转换增强 LLM 的分子理解能力
研究人员推出 MolBasic,一个旨在增强大型语言模型 (LLM) 分子理解能力的新框架。该方法解决了 LLM 无法可靠地从标准 SMILES 中捕获分子图的问题,这是化学中结构决定功能的根本方面。MolBasic 利用 SMILES-图转换机制来对齐序列和拓扑表示,并辅以多级结构感知基准和带有思维链提示的渐进式学习方案。实验表明,MolBasic 显著提高了结构理解能力,并在属性预测和优化等下游任务上取得了更好的性能。
-
新型神经网络融合三维几何、拓扑和物理学用于分子预测
研究人员开发了一种新颖的三分支模块化融合神经网络,旨在改进分子性质预测。该框架整合了三种不同的数据模态:使用SchNet的三维空间几何、通过SMILES和ChemBERTa的离散拓扑语法,以及来自Deep & Cross网络的显式宏观理化描述符。通过结合这些正交流,该模型克服了图神经网络等传统方法的局限性,如过平滑,并在QM9基准测试中实现了0.0207 eV的原子化能预测平均绝对误差。该高效架构拥有不到一百万个参数,显著降低了误差,…
-
BPE 对比 Unigram-LM:分词算法为化学 SMILES 创建了不同的词汇表
一篇新的研究论文探讨了两种常见的分词方法——字节对编码 (BPE) 和 Unigram-LM——在应用于化学 SMILES 字符串时产生的差异。研究发现,这些算法会产生显著不同的词汇表,其中 Unigram-LM 将分子分割成比 BPE 更多的 token。这表明子词算法的选择对于化学语言模型来说是一个关键的建模决策,而不是一个默认设置。
-
Rust库通过显式图格式增强LLM分子推理能力
一个名为chematic的Rust化学信息学库已被开发出来,以改进大型语言模型(LLM)处理分子数据的方式。该库通过引入显式图表示(如ChemicalJSON)来解决使用简单SMILES字符串的局限性,这使得LLM能够更直接地读取分子结构。此外,chematic通过提供属性数据和结构摘要来增强上下文,其灵感来源于研究论文,这些论文表明当提供更丰富的信息时,分子推理任务的准确性会显著提高。
-
新的 FisherSketch 方法在大规模下分析 LLM 更新几何
研究人员开发了 FisherSketch,一种用于分析具有共享词汇的大型语言模型 (LLM) 更新几何的新颖方法。该技术通过直接估计头部 Fisher 对齐,实现了在蛋白质和基因组序列等科学领域的无训练源选择。FisherSketch 在单次流式处理中运行,使其在计算上适用于大规模应用,这与传统方法不同。
-
使用稀疏自编码器分析化学语言模型的内部表征
一篇新研究论文通过将稀疏自编码器(SAE)应用于MolFormer,探讨了化学语言模型(cLMs)的内部工作机制。研究表明,模型的早期层关注句法模式和位置跟踪,而后期层则捕获更多有意义的语义信息,包括药理学相关特征。研究还发现,非规范SMILES字符串比无效SMILES字符串对模型表征的干扰更大,这凸显了输入格式的重要性。为了便于进一步研究,作者开发了InterMol,一个用于可视化SAE激活的交互式工具。
-
BioMatrix 将序列、结构和语言整合到新的多模态基础模型中
研究人员开发了 BioMatrix,这是一种新颖的多模态基础模型,旨在将序列、结构和自然语言等生物数据类型整合到单一架构中。与以往专注于多模态或广泛实体覆盖的模型不同,BioMatrix 通过将各种生物输入映射到共享的离散标记空间来统一这些方面。BioMatrix 基于 Qwen3 语言模型构建,在一个海量数据集上进行了预训练,并在 80 个多样化的生物任务中的 77 个上展现了最先进的性能。
-
新的基准测试MolGraphBench评估用于分子回归任务的图神经网络
一项名为MolGraphBench的新基准测试已被推出,用于评估用于分子回归任务的图神经网络(GNN)架构。该基准测试由Ishaan Gupta提出,分析了四种常见的GNN模型,发现图卷积网络(GCN)和图同构网络(GIN)表现最佳。研究还表明,在融合框架中,分子指纹可能与GNN不互补,并强调了将GNN层类型视为可调超参数以获得更优性能的重要性。
-
研究发现大语言模型(LLM)的分子任务依赖于表示
一项新的arXiv研究对16个大语言模型在九种分子表示和八种化学任务上的性能进行了基准测试。研究发现,模型的性能在很大程度上取决于所使用的分子表示,其中CML和MolJSON等显式结构化文本格式在结构任务上表现出色,而IUPAC在语义任务上表现最佳。专门从事化学的模型在使用SMILES时表现强劲,但在结构化格式方面遇到困难,这表明其评估可能存在偏见。