实体
SciVisAgentBench
SciVisAgentBench
PulseAugur coverage of SciVisAgentBench — every cluster mentioning SciVisAgentBench across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
新基准评估用于科学数据分析和可视化的AI代理
研究人员推出了SciVisAgentBench,这是一个旨在评估AI代理在执行科学数据分析和可视化任务方面能力的新基准。该基准横跨四个维度:应用领域、数据类型、复杂性级别和可视化操作,并包含108个专家精心设计的案例。它采用多模态评估流程,结合了基于LLM的评判与确定性指标和验证器,以确保可靠的评估。该基准旨在促进系统性比较、识别故障模式并推动代理式科学可视化的进步。
-
新代理技能提升AI在科学数据分析中的能力
研究人员开发了一套名为SciVisAgentSkills的新代理技能,旨在增强AI代理在科学数据分析和可视化方面的能力。这些技能为代理提供了ParaView、napari和VMD等工具的专业知识,提高了它们处理复杂、多步骤任务的能力。使用SciVisAgentBench基准进行的评估表明,这些技能提升了Codex和Claude Code等代理的性能和令牌效率,凸显了结构化程序化知识在科学工作流程中的价值。