AI Scientist: The Next Generation Scientific Research Paradigm Driven by Scientific and Technological Information
PulseAugur coverage of AI Scientist: The Next Generation Scientific Research Paradigm Driven by Scientific and Technological Information — every cluster mentioning AI Scientist: The Next Generation Scientific Research Paradigm Driven by Scientific and Technological Information across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新基准TruthInsightBench评估AI科学发现能力
研究人员推出了TruthInsightBench,这是一个旨在评估自主代理科学发现能力的新基准。与侧重于重现已知结果的现有基准不同,TruthInsightBench向代理提供盲任务和冻结数据,要求它们自行确定和证明其主张。该基准通过六个证据成熟度维度来评估代理,并进行自动化评分以确保可重复性。对四个编码代理的初步测试显示性能停滞不前,表明虽然代理能够胜任地执行和记录分析,但它们在真正发现所需的关键科学判断方面存在困难。
-
HypoForge:AI框架学习科学技能以进行假设生成和测试
研究人员推出 HypoForge,一个旨在增强自动化科学发现的新型多智能体框架。该系统学习可重用的科学技能,用于生成和测试假设,并根据每个阶段可用的特定监督信号调整其学习策略。对于假设生成,它使用生成器-判别器对抗机制,而对于假设测试,它从经验结果中学习。实验表明,HypoForge 在性能上优于现有的 AI 科学家框架。
-
Google AI 推出 Science One Framework 以实现可验证的科学研究
Google AI 推出了 Science One Framework,这是一个旨在提高 AI 生成的科学研究可验证性的实验性系统。该框架及其附带的 CoE Audit 协议旨在消除幻觉,并确保 AI 撰写的论文中的主张得到可验证证据链的支持。该系统解决了当前自主研究流程中普遍存在的幽灵引用以及描述方法与实际代码之间不匹配等关键问题。
-
人工智能科学家工作流在材料科学中展示可转移的发现 · 跟踪 2 个来源
研究人员开发了可审计的人工智能科学家工作流,旨在确保材料科学中人工智能驱动的发现是稳健且可转移的。该研究涉及七个不同的搜索过程,评估了十个 Matbench 端点上的 700 多项变更,代理从五个内部折叠中获得平均反馈,以减轻对单一数据分割的依赖。一项关键发现是,当在未接触过的独立数据上进行评估时,所选的变更在十个案例中有九个被证明是最佳的单一干预措施,这表明人工智能代理可以产生可执行的发现,这些发现能够经受住未见的证据,并可跨任务重用。
-
指南帮助实验室选择合适的AI科学家模型
一项指南已发布,旨在帮助研究人员选择最适合其特定实验室需求的AI科学家模型。该出版物旨在阐明可用的AI研究工具及其在科学发现中的应用。
-
AI 自进化可能始于外部系统,而非模型权重
前 OpenAI 安全副总裁 Wonyong Li 提出了一条 AI 自进化的新路径,建议从外部操作系统(Harness)开始,而不是直接修改模型权重。该 Harness 系统负责管理工具使用、上下文、任务拆分和结果验证,并可根据观察到的失败进行迭代改进。DeepSeek 的崔天言等研究人员认为,改进 Harness 是 AI 进步的一个有前景的方向,有可能在不改变核心模型的情况下实现显著的性能提升。
-
新基准 CausalGame 测试大型语言模型智能体的因果推理能力
研究人员推出了 CausalGame,这是一个旨在评估大型语言模型 (LLM) 智能体因果思维能力的新基准。该基准通过纳入选择偏差、测量误差和隐藏混淆因素等现实世界挑战,解决了现有 AI 科学家评估的局限性。CausalGame 要求 LLM 智能体在 14 个不同的场景中主动设计实验、收集数据并报告结果。对 30 个 LLM 智能体的初步测试显示,没有一个表现出可靠的因果推理能力,表现最好的模型得分远低于分析最优值。
-
新架构强制执行AI发现中的统计严谨性
研究人员开发了一个功能性架构,以增强AI驱动的科学发现中的统计严谨性,旨在防止产生虚假结果。该系统采用基于Haskell的Research monad在错误预算内强制执行假设检验,并使用沙盒环境将验证数据与LLM代码执行物理隔离。该架构包括一个机器检查的Lean 4形式化在线错误发现率控制程序,通过IEEE 754算术验证到SPARK/Ada实现。模拟显示,该系统有效控制了错误发现率,使其接近1%的目标5%,显著优于达到41%的朴素方法。
-
专有数据而非推理能力限制了AI药物估值
一篇新的研究论文探讨了数据访问对AI科学家在药物资产估值方面表现的影响。研究发现,虽然推理能力和工具可以改善校准,但专有数据显著提高了AI恢复相关信息和做出明智决策的能力。如果没有经过策划的专有数据集的访问权限,AI的表现将受到根本性限制,无论其推理能力多么先进。
-
AI科学家方法探索Flow-Lenia动力学
研究人员开发了一种新颖的好奇心驱动的AI科学家方法,用于探索Flow-Lenia(一种连续元胞自动机)中的复杂动力学。该AI方法利用内在动机的目标探索过程,通过分析进化活动和压缩比等指标来识别系统级行为。事实证明,该方法在揭示类似生物现象的多样化自组织模式方面比随机搜索更有效,并揭示了更大空间尺度上的宏观组织。
-
AI行业转型重塑2026年职业生涯
AI行业正在经历重大的职业转型,组织越来越多地采用Agentic AI、多智能体系统、AI治理和RAG管道。这种转变正在重塑传统的职业道路,到2026年,专业人士将从入门级职位转向AI工程师、顾问、科学家,并最终成为首席AI官等专业职位。重点是构建强大的企业AI架构来支持这些高级功能。