PulseAugur
实时 10:36:38
实体 SciLitBench

SciLitBench

PulseAugur coverage of SciLitBench — every cluster mentioning SciLitBench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_244784 ·

    新基准SciLitBench评估LLM在系统性文献综述中的能力

    研究人员推出了SciLitBench,这是一个旨在评估大型语言模型(LLM)在执行系统性文献综述方面能力的新基准。该基准涵盖了多个阶段,包括标题和摘要筛选、全文筛选以及数据提取,使用了超过42,000条记录的数据集。对22个开源LLM进行的实验显示,虽然明确的标准提高了筛选性能,但数据提取的准确性差异很大,模型在准确提取计算方法或局限性等详细信息方面存在困难。SciLitBench突显了LLM在全面证据综合方面当前能力的局限性,区分了…