实体
SDABench
SDABench
PulseAugur coverage of SDABench — every cluster mentioning SDABench across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
2 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
新基准显示大型语言模型在复杂科学推理方面存在困难
开发了两个新基准 PHD 和 SDABench,用于评估大型语言模型 (LLM) 在科学发现和数据分析方面的能力。PHD 侧重于模型从不确凿证据中自主构建假设空间的能力,而 SDABench 则评估了包括探索、推理和跨不同科学领域的机械推理在内的六项特定科学能力。对 15 个大型语言模型的初步评估表明,虽然模型在描述性任务方面表现出色,但在更复杂的推理、假设选择和机械解释方面存在困难,这表明它们在科学发现潜力方面存在显著差距。
-
大型语言模型影响冲突信息、科学发现和企业人工智能 · 跟踪 7 个来源
近期研究突显了大型语言模型(LLM)不断发展的格局及其对各个领域的影响。一篇论文探讨了人工智能答案引擎如何塑造全球冲突信息环境,发现围绕冲突的可检索记录越少,幻觉就越多,越容易受到生成引擎优化(GEO)以进行虚假信息传播的影响。另一项研究介绍了 SDABench,这是一个旨在评估 LLM 在不同领域和推理类型中的科学发现能力的新基准,结果显示,虽然模型在描述性分析方面表现出色,但在机械推理等更复杂的任务方面却举步维艰。同时,关于开源人…