PulseAugur
中
实时 18:13:57
实体 Smiles

Smiles

PulseAugur coverage of Smiles — every cluster mentioning Smiles across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
33
90 天内 33
发布 · 30天
0
90 天内 0
论文 · 30天
33
90 天内 33
层级分布 · 90 天
主题
关系
情绪 · 30 天

4 天有情绪数据

最近 · 第 1/2 页 · 共 35 条
  1. TOOL · CL_284491 ·

    新框架赋能药物发现的可控分子生成

    研究人员开发了一个名为“基于扩散语言模型的跨模态可控分子生成”(CMCM-DLM)的新框架,用于生成具有特定性质的分子。这种模块化方法扩展了预训练的扩散模型,使其能够处理各种约束,而无需重新训练整个模型。CMCM-DLM采用分阶段设计,其中结构控制模块用于建立分子骨架,属性控制模块用于指导生成过程以获得所需的化学性质,并在药物发现应用中证明了其有效性。

  2. TOOL · CL_268994 ·

    ChemMLLM:用于化学理解和生成的新型多模态大语言模型

    研究人员推出 ChemMLLM,这是一种新颖的多模态大语言模型,专为化学理解和生成而设计。该模型通过整合文本、分子 SMILES 字符串和图像,解决了化学 MLLM 的跨模态能力差距。ChemMLLM 已与各种领先模型进行了基准测试,在图像生成等多个任务中,其性能优于通用 MLLM,并与专业模型相比具有竞争力。

  3. RESEARCH · CL_267192 ·

    新研究探讨LLM的效率、安全性和多语言能力

    研究人员正在探索各种方法来提高大型语言模型(LLM)的效率和能力。Apple Inc. 发表了关于通过增强语言辨别能力来改进多语言语音模型的研究。其他研究侧重于参数高效微调技术,如DyPAM和GRADE;理解模型内部机制的方法,如Massive Activation Gating Channel (MAGC) 和 COMPASS;以及高效推理策略,如VALSE和Hybrid Latent Attention (HLA)。此外,正在开发…

  4. TOOL · CL_245303 ·

    GraphNOSE: 新型图变换器预测嗅觉特性

    研究人员开发了GraphNOSE,一个开源的图变换器框架,用于从分子结构预测嗅觉特性。与现有的线性模型、分子语言模型嵌入和图神经网络相比,这个新模型表现出更优越的性能,尤其是在泛化到新颖的化合物和混合物方面。GraphNOSE采用基于变换器的图架构,集成了位置和结构编码,以显著少于传统图神经网络的参数实现了高精度。该框架还纳入了可解释AI方法,以识别影响气味预测的关键分子亚结构和特征,提供了化学上直观的见解。

  5. TOOL · CL_239270 ·

    研究发现:前沿大型语言模型广泛存在分子数据逐字检索现象

    一篇新发表在arXiv上的研究论文,调查了前沿语言模型中“分子似曾相识”的现象,即模型似乎是逐字检索已发布的分子属性值,而非进行预测。研究发现,这种逐字检索现象普遍存在,但在不同的回归基准测试中差异显著。有趣的是,当模型被赋予更高的推理提示时,检索率会显著增加。该研究还探讨了中断这种检索的方法,并提出模型的通用预测能力并非完全由记忆的值决定。

  6. TOOL · CL_231407 ·

    新方法使用概率模型检查用于AI序列模型

    研究人员开发了一个新流程,使用概率模型检查来分析自回归神经网络序列模型,解决了传统测试集准确性的局限性。该方法量化了采样可以访问但贪婪解码可能遗漏的概率质量,并确定了满足域要求的输入总体分数。该流程从模型中提取马尔可夫链,使用PRISM模型检查器验证规范,并提供可达性概率的认证区间,通过CEGAR循环来优化结果并提取证伪轨迹。

  7. RESEARCH · CL_229334 ·

    AI利用语言引导晶体和分子结构生成

    两篇新研究论文介绍了使用语言信息流匹配进行结构生成的新方法。第一篇TFMat使用结构化文本引导晶体结构生成,提高了匹配率和与期望属性的一致性。第二篇LiFT采用语言衍生的化学先验知识来指导用于药物设计的3D分子生成,在保持结构有效性的同时提高了药物化学指标。

  8. TOOL · CL_229177 ·

    新型代理LLM S3C-LLM增强分子结构阐明

    研究人员开发了S3C-LLM,这是一种新颖的代理语言模型,用于分子分析中的光谱到结构阐明。与直接将光谱转换为SMILES的先前方法不同,S3C-LLM通过检索特定技能、执行分析代码以及整合证据来生成分子结构,从而模仿光谱学家的分析过程。该方法使用Qwen3-4B模型的监督微调和强化学习策略进行训练,与现有的通用和光谱特定模型相比,表现出卓越的性能。

  9. TOOL · CL_218170 ·

    大语言模型驱动的框架增强分子逆向设计

    研究人员开发了一个名为“method”的闭环框架,用于分子逆向设计,该框架利用大语言模型(LLM)来处理任务指令、优化历史和预言机反馈。该方法旨在提高生成的分子与所需属性匹配的比例。在药物和材料设计任务上的实验表明,“method”的表现优于单次提示,并且与基于高斯过程的贝叶斯优化基线相比具有竞争力或更优。该框架以自然语言提供了可检查的优化轨迹,并观察到领域相关的性能变化。

  10. RESEARCH · CL_217681 ·

    VERDICT系统提升化学结构识别准确性

    研究人员开发了一个名为VERDICT的新系统,提高了光学化学结构识别(OCSR)的准确性。VERDICT利用多个识别器之间的一致性,其性能优于像素空间验证方法。这种方法对于通过可靠地识别和验证化学结构来从科学文献中构建大规模化学训练数据集至关重要。

  11. RESEARCH · CL_200121 ·

    新的VLSR框架通过本地化增强LLM分子推理能力

    研究人员开发了视觉潜在结构推理(VLSR)框架,旨在改进大型语言模型(LLM)理解分子结构和预测其性质的方式。与直接处理分子图像或使用SMILES等文本表示的先前方法不同,VLSR首先识别分子图像中化学上重要的区域。然后,它利用这些局部区域在潜在空间中进行推理,从而实现更专注、更高效的分析。据报道,与基于文本的推理基线相比,该方法实现了9.6倍的更高吞吐量。

  12. RESEARCH · CL_195817 ·

    新型分子大语言模型使用子结构推理以改进属性预测

    研究人员开发了MR-MoL,这是一种新颖的分子大语言模型(LLM),用于药物发现中的属性预测。与现有隐式表示分子的模型不同,MR-MoL显式地将子结构归因作为推理。这种推理源自微调的图神经网络,通过突出显示不同粒度(如Murcko骨架、BRICS片段和官能团)的影响分子成分来指导LLM。该模型在八项MoleculeNet任务上表现出色,优于通用模型,并缩小了与专用模型的差距,同时诊断证实了其有效利用了提供的推理。

  13. TOOL · CL_191112 ·

    MolBioKG 系统将未注册分子置于生物医学知识图谱中

    研究人员开发了 MolBioKG,一个旨在将未注册分子连接到生物医学知识图谱的新型两层系统。该系统通过使用多分辨率结构锚定将未见过的分子置于现有的生物医学证据中,解决了“图外分子”的挑战。MolBioKG 仅使用 SMILES 字符串即可检索结构相关的图实体并遍历其生物医学邻域,在多跳推理和图外目标召回等任务中表现优于现有方法。

  14. TOOL · CL_183439 ·

    MinerU.Chem系统在化学结构识别方面达到93%的准确率

    一个名为MinerU.Chem的新系统已被开发出来,用于从有机化学文档中提取化学结构和反应,并将其转换为机器可读的数据。该系统集成到MinerU平台中,使用一种称为CARBON的核心表示来保留视觉布局和化学语义。在评估中,MinerU.Chem在识别分子结构方面达到了93.02%的准确率,在MolRecBench-Wild数据集上,其性能比GPT 5.6 "Sol"高出18个百分点以上。

  15. TOOL · CL_183344 ·

    新模型CheMatE统一化学结构和自然语言

    研究人员开发了CheMatE,这是一种新的嵌入模型,旨在统一空间中联合表示化学结构(SMILES)和自然语言。CheMatE基于ModernBERT骨干构建,采用两阶段训练过程:在大量科学文档语料库上继续进行掩码语言建模,随后与算法生成的SMILES-文本对进行对比学习。这种方法旨在防止对化学语法过度拟合,并保留基础语义能力,在分子性质预测和科学语言理解任务中展现出稳健且可迁移的表示。

  16. TOOL · CL_180860 ·

    新的SIGMA目标改进了分子自回归模型

    研究人员开发了SIGMA,一种用于自回归分子模型的新型目标函数,它提高了模型在不考虑序列化格式的情况下为分子分配概率的能力。该方法使用具有化学认证的相同后缀三元组的密集后缀位置目标来对齐隐藏状态并减少不一致的下一个标记决策。SIGMA已在各种数据集和表示中证明了Frechet ChemNet距离的降低,并提高了分子属性基准的平均预测性能。

  17. TOOL · CL_180843 ·

    新的生成模型InVirtuoGen推动了基于片段的药物发现

    研究人员开发了InVirtuoGen,这是一种新颖的离散流生成模型,专为基于片段的药物发现而设计。该模型将生成范式从完成转向精炼,从而能够更有效地从头生成分子和优化属性。与现有方法相比,InVirtuoGen在实际分子优化基准测试中表现出卓越的性能,并在先导优化中获得了更高的对接分数。该项目通过发布预训练的检查点和代码以实现可重复性,强调了开放科学。

  18. TOOL · CL_180684 ·

    新的 Python 库连接分子机器学习与 scikit-learn

    一个名为 scikit-fingerprints 的新 Python 库已发布,旨在将分子机器学习功能与 scikit-learn 生态系统集成。该库基于 RDKit 构建,为分子指纹、相似性度量和数据拆分策略提供了一个统一的接口,旨在简化分子机器学习工作流程的原型设计、复现和部署。目标是使这些化学信息学工具更容易获得,并与更广泛的 Python 机器学习领域兼容。

  19. TOOL · CL_171881 ·

    新的 Q-Steer 方法提升了 AI 语言模型的分子优化能力

    研究人员推出了一种名为 Q-Steer 的新方法,旨在增强语言模型的分子策略优化能力。该技术通过估计中间动作的下游奖励来解决分子生成中延迟反馈的挑战。Q-Steer 包含一个冻结的前缀动作价值评分器 PAVS-Q,它在生成过程中向采样 logits 添加了一个归一化的价值奖励。在 PMO23 数据集上的实验表明,在固定的在线 Oracle 预算内,Q-Steer 在各种分子语言模型骨干和优化器上持续提高了平均有效唯一分数,优于基线方法。

  20. RESEARCH · CL_158706 ·

    OLEDLM:用于OLED分子设计的新型语言模型

    研究人员开发了OLEDLM,一个专门为有机发光二极管(OLED)分子设计而设计的创新语言模型。该模型利用LLaMA风格的Transformer架构作为基础化学语言模型,然后使用基于BERT的属性预测器和强化学习进行微调。该框架旨在通过密度泛函理论验证,高效生成具有所需光电特性的OLED SMILES序列。