Chemistry
PulseAugur coverage of Chemistry — every cluster mentioning Chemistry across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
新基准 EurekaBench 测试 AI 代理的科学发现能力
研究人员开发了 EurekaBench,这是一个旨在评估 AI 代理科学发现能力的基准。该基准涵盖神经科学、计算机科学、化学、天体物理学、地球物理学和等离子体物理学等多个领域,并评估代理从观察到的数据中发现解释性潜在机制的能力。尽管当前的 AI 代理在优化预测准确性方面表现出色,但在从其发现中获得有意义的科学见解方面,它们远远落后于人类科学家。
-
AI训练方法在没有明确推理监督的情况下蒸馏领域专业知识
研究人员开发了一种新的训练专业AI模型的方法,该方法侧重于在不需要教师模型的明确推理监督的情况下蒸馏领域专业知识。该方法利用学生模型作为探针,来分析在训练过程中专家模型隐式选择的潜在推理轨迹。研究发现,专家模型和学生模型的专业化-泛化特征之间存在很强的相关性,这表明控制专家模型的分布漂移可以系统地影响蒸馏学生模型在领域精度和通用能力保持之间的权衡。该技术为专家训练提供了新的视角,强调了在没有明确推理的情况下,调整选择如何直接控制潜在监督。
-
AI、量子计算和自主实验室融合,重塑化学领域
一篇题为“融合实验室”的新评论文章探讨了AI、自主代理、高性能计算和量子计算对化学和材料科学的变革性影响。作者们借鉴了一次顶尖研究人员会议的成果,认为这些技术正处于一个关键节点汇聚,有望加速发现并颠覆传统的科学方法。这种融合预计将极大地推动化学科学的发展。
-
新的专家验证的STEM问答数据集挑战前沿AI模型
一个名为“专家验证的STEM问答”的新数据集已被开发出来,以解决现有AI评估数据集的局限性。该数据集包含物理、化学、生物和数学领域的398个问题,由241名领域专家创建和验证。初步测试显示,前沿AI模型在该数据集上的表现低于25%,表明其作为具有挑战性的基准的潜力。在数据集的私有版本上进行进一步训练,使一个开源模型在相关的STEM基准上的表现提高了15%。
-
机器学习加速化学和能源研究的发现
研究人员正在探索使用机器学习来加速新分子的设计和合成,特别是在化学和能源领域。这种方法旨在提高发现具有所需特性的新型材料的效率和速度。将人工智能融入化学研究有潜力在各种科学和工业应用中取得突破。
-
香港将于2029-30学年起修订高中科学与数学课程
香港将于2029-30学年开始全面改革高中科学与数学课程。此举旨在提高学生选修科学科目的比例,并培养创新科技人才。拟议的变更包括为物理、化学和生物学提供额外的课程选项,并已发布课程草案供公众咨询。
-
新基准揭示多模态大语言模型在科学发现方面存在困难
一项名为 Science Edge Evaluation (SEE) 的新基准已被开发出来,用于评估多模态大语言模型 (MLLMs) 在复杂科学发现任务中的能力。在 19 个 MLLMs 中,达到的最高准确率为 48.7%,通用模型表现优于科学专业模型。即使使用工具,准确率也仅达到 52.7%,这表明当前的 MLLMs 难以在实验证据的界限内管理工具派生信息,并且无法可靠地进行基于证据的推理,而这是真正科学发现的关键步骤。
-
人工智能革新化学研究,加速材料发现
人工智能正日益融入化学研究,超越了传统的试错方法。AI算法可以分析庞大的分子空间,预测性质,并提出合成路线,从而加速新材料的发现。诺贝尔奖得主Omar Yaghi前往中国领导一个专注于人工智能的材料研究所,这体现了AI人才在科学研究领域日益加剧的地缘政治竞争。Molecule.one等公司也正在利用AI,例如GPT-5.4,来改进复杂的化学反应。
-
新基准显示大型语言模型在复杂科学推理方面存在困难
开发了两个新基准 PHD 和 SDABench,用于评估大型语言模型 (LLM) 在科学发现和数据分析方面的能力。PHD 侧重于模型从不确凿证据中自主构建假设空间的能力,而 SDABench 则评估了包括探索、推理和跨不同科学领域的机械推理在内的六项特定科学能力。对 15 个大型语言模型的初步评估表明,虽然模型在描述性任务方面表现出色,但在更复杂的推理、假设选择和机械解释方面存在困难,这表明它们在科学发现潜力方面存在显著差距。
-
Lila Sciences 构建人工智能驱动的自动化实验室以进行科学发现
Lila Sciences 正在构建一个自动化实验室,旨在作为人工智能数据中心运行,生成大量经过实验验证的科学数据。他们的愿景是通过将实验室视为无限的 token 生成器来创造科学超级智能,同时解决生物学、化学、药物发现和材料科学领域的问题。该公司强调其自动化的灵活性和通用性,目标是优化快速迭代和广泛的科学探索,而不仅仅是原始吞吐量。
-
AI模型NMIRacle破译光谱中的分子结构
研究人员开发了NMIRacle,一个新颖的AI框架,旨在从光谱数据中阐释分子结构。这个两阶段生成模型首先从片段表示重建分子,然后使用来自IR、1H-NMR和13C-NMR的光谱嵌入直接生成分子结构。NMIRacle在性能上优于现有方法,即使在分子复杂度增加的情况下也能准确预测分子。
-
KARMA系统使用知识图谱进行自动化推理和对齐
研究人员推出 KARMA,一种使用知识图谱进行自动化推理和对齐的新方法。KARMA 通过从知识图谱生成模式约束路径并将其表述为对比候选来解决分辨率不匹配问题。该方法与槽位并行对齐 (SPA) 结合,将监督引导至区分性实体槽位,在生物医学、计算机科学和化学等基准测试中表现优于标准微调和其他基于偏好的方法。
-
基础模型在多智能体系统中协调以增强推理能力 · arXiv 研究
研究人员开发了一个多智能体框架,通过协调不同的模型来增强基础模型的推理能力。该系统包括生成初步草稿的求解器模型、通过结构化批评进行改进的批评智能体,以及综合最终共识的聚合器。评分模块评估解决方案的语义、数值和程序方面。实验表明,模型异质性是性能提升的关键驱动因素,而非框架架构或冗余采样,从而使准确性提高了 2.3 倍,并提高了分步推理质量。
-
诺贝尔奖得主Omar Yaghi加盟中国清华大学领导人工智能材料研究
诺贝尔奖得主Omar Yaghi已从美国移居中国,领导清华大学新的人工智能驱动研究中心。他的团队将专注于利用人工智能加速新材料的发现和合成,以应对碳中和、水资源短缺等全球性挑战。Yaghi还打算在该领域培训年轻科学家,即人工智能驱动的化学。
-
AI医疗调度公司Assort Health融资1.2亿美元,估值达12亿美元
Assort Health是一家专注于安排医疗预约的AI初创公司,已在其第三轮风险融资中获得1.2亿美元,使其估值达到12亿美元。该公司的AI语音聊天机器人负责为医生安排预约,旨在提高患者和医疗服务提供商的效率。最新一轮融资由Menlo Ventures领投,将用于支持开发新技术,以处理除预约之外更广泛的患者互动。
-
新框架使AI代理能够进行原子尺度研究
研究人员开发了AtomisticSkills,这是一个开源框架,旨在使AI编码代理能够在材料科学、化学和药物发现领域执行复杂的原子尺度研究。该框架将科学工作流组织成模块化技能和工具,集成了超过100项精选功能,如数据库访问、热力学建模和模拟引擎。AtomisticSkills已通过多种科学活动得到验证,包括电解质的生成设计和催化剂筛选,使其成为开发自主AI科学家的关键基础设施。
-
LLM在高级化学任务中的评估,配备新基准
研究人员开发了新的基准和方法来评估和增强大型语言模型(LLM)在化学相关任务中的能力。其中一种方法,Speak-to-Structure(S^2-Bench),专注于开放域分子生成,超越了简单的“一对一”映射,以评估创造性和多样化的分子设计能力。另一种方法引入了原子锚定的LLM,它使用独特的原子标识符来锚定链式思维推理以进行分子转化,在逆合成等任务中取得了很高的成功率,而无需进行特定任务的训练。
-
ComfyUI 估值达 5 亿美元,创作者寻求对 AI 生成媒体的更多控制权
ComfyUI 是一家初创公司,通过基于节点的工作流程为创作者提供对 AI 生成媒体的精细控制,该公司已获得 3000 万美元的新融资,估值达到 5 亿美元。该平台最初于 2023 年作为一个开源项目出现,通过提供对整个创作过程的模块化控制,解决了基于提示的 AI 图像和视频生成的局限性。ComfyUI 拥有超过 400 万用户,被视觉效果、动画和广告等领域的专业人士使用,凸显了对精确 AI 输出定制日益增长的需求。
-
新方法提高文本到图像检索和知识生成准确性
研究人员推出 KVBench,这是一个旨在评估知识密集型领域中文本到图像模型准确性的新基准。该基准涵盖生物学、化学和物理学等学科,揭示了当前模型存在的显著缺陷,尤其是在逻辑推理和符号精度方面。为解决这些问题,提出了一种名为 KE-Check 的框架,通过提示丰富和约束执行来提高科学保真度,从而减少不准确性。