AI4Science
PulseAugur coverage of AI4Science — every cluster mentioning AI4Science across labs, papers, and developer communities, ranked by signal.
-
SCION系统整合AI工具以实现可审计的科学发现
一篇新论文介绍SCION,一个旨在将碎片化的AI4Science工具整合为连贯研究过程的代理科学操作系统。SCION利用科学代理和研究执行计划(REP)来管理任务、工具和内存,将科学发现转化为可审计和可重用的操作流程。在材料分析、分子设计和蛋白质筛选方面的实验表明,SCION在分解、验证、优化和内存重用方面优于现有的自主研究代理。
-
新的多智能体系统DDIAgents增强药物-药物相互作用预测
研究人员开发了DDIAgents,一个旨在改进药物-药物相互作用(DDIs)预测的新型多智能体框架。该系统通过使用规划器智能体来实例化专门的专家智能体,根据推断的相互作用机制路由相关信息,并聚合分析,从而动态地组织生物医学知识。通过使上下文流适应特定机制,DDIAgents旨在减少不相关数据并增强可解释性。在DDI预测基准上的实验表明,DDIAgents的性能优于包括基于LLM和其他基于智能体的方法在内的现有方法,展示了其在自适应和可…
-
新的SciRisk-Bench基准评估科学领域AI的安全性
研究人员推出了SciRisk-Bench,这是一个旨在评估科学应用(AI4Science)中AI模型安全性的新基准。该基准评估模型识别和规避跨不同科学学科和特定风险维度的能力。SciRisk-Bench涵盖7个学科、31个子学科和10个不同的风险维度,比以往的数据集提供了对科学领域AI安全性的更详细分析。
-
新基准PolyBench增强LLM在聚合物设计方面的能力
研究人员开发了PolyBench,这是一个全面的基准数据集和训练方法,用于专注于聚合物设计任务的大型语言模型(LLM)。该数据集包含超过125,000个任务,并利用了数百万个数据点的知识库,旨在为LLM提供聚合物科学所需的特定知识和推理能力。实验表明,使用PolyBench的知识增强推理蒸馏方法训练的较小语言模型,在聚合物相关挑战方面可以超越同等大小的模型,并与更大、闭源的LLM竞争,这预示着AI在科学发现方面取得进展的希望。
-
新基准SciPaths测试AI预测科学发现路径的能力
研究人员推出了SciPaths,这是一个旨在通过识别赋能性贡献及其对先前工作的依赖性来预测科学发现路径的新基准。与专注于引文预测等更简单任务的现有基准不同,SciPaths要求模型从目标贡献向后推理到必要的构建块。对当前前沿和开源语言模型的评估表明,即使是最好的模型也难以进行这种复杂的推理,F1分数仅为0.189,表明准确恢复方法论依赖性仍然是一个重大挑战。