natural science
PulseAugur coverage of natural science — every cluster mentioning natural science across labs, papers, and developer communities, ranked by signal.
-
新框架 reSolve 增强了智能体技能演进和可复现性
研究人员开发了 reSolve,一个旨在改进智能体技能创建和可复现性的新框架。该系统解决了自我演进技能表现不如人类精心策划的技能以及智能体在部署时难以复现已学技能的常见问题。reSolve 利用代理验证器来增强稀疏奖励信号,并采用由该验证器引导的束搜索来构建解决方案。在测试中,这种方法使一个基础模型能够自我演进出达到 74.9% 的 mean-of-3 分数的技能,显著优于人类精心策划的基线模型和强大的 GPT-5.5/OpenHands 模型。
-
新的Sci-VBench基准揭示AI科学视频生成能力的差距
研究人员推出了Sci-VBench,这是一个旨在评估AI模型在科学领域生成视频能力的新基准。该基准包含自然科学、医疗保健、人文学科和工程学领域超过1200个专家标注的示例,要求模型展示科学推理和知识综合能力。对16个模型的初步评估显示,专有系统和开源系统之间存在显著差距,尤其是在科学和因果正确性方面,这表明尽管视觉真实性有所提高,但当前的视频生成模型在准确表示复杂动态方面仍面临挑战。
-
AI 设计新型病毒;Airbnb 声称在 AI 领域处于领先地位;OpenAI 面临不当行为指控 · 跟踪 2 个来源
已开发出一种 AI 系统,能够设计基因上差异很大的杀菌病毒版本,这是生物 AI 应用的重大进展。另外,Airbnb 的 CEO Brian Chesky 声称该公司正在成为 AI 领域的领导者,并将产品发布速度的加快归功于 AI 的集成。与此同时,OpenAI 因其近期在数学突破方面的研究不当行为指控而受到专家批评。
-
人工智能的模仿与人类对故事的理解
作者反思理解的本质,将科学真理与人类观察宇宙的经验进行类比。他们强调故事和语言在人类认知和社会互动中的基本作用,并指出这些叙事如何塑造我们对现实的看法。文章将人类天生的讲故事的驱动力与当前人工智能的能力进行了对比,称其为缺乏真正理解或道德的复杂模仿者。
-
新LOGOS模型通过LLM集成统一科学任务
研究人员推出LOGOS,一个专为自然科学设计的生成基础模型,在一个自回归框架内统一了各种科学任务。通过将科学对象及其空间相互作用编码为标记序列,LOGOS在没有显式坐标的情况下捕捉复杂的结构关系。该模型以10亿、30亿和80亿参数的规模进行训练,持续匹配或超越领域特定基线,表明AI in Science (AI4S)与大型语言模型集成的一种统一方法。模型权重和资源正在发布,以鼓励进一步研究。