PulseAugur
实时 20:02:25
实体 WuYu-EnvLE-Bench

WuYu-EnvLE-Bench

PulseAugur coverage of WuYu-EnvLE-Bench — every cluster mentioning WuYu-EnvLE-Bench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_154100 ·

    新基准评估大型语言模型在环境执法领域的处理能力

    一个名为 WuYu-EnvLE-Bench 的新基准已被开发出来,用于评估大型语言模型(LLMs)在环境执法领域的处理能力。该基准源自真实案例和专家评审,包含 14 个任务和 12 个污染子领域的 2,521 个实例。初步评估显示,虽然 LLMs 在受规则约束的任务上表现良好,但在证据链构建和多源整合等复杂推理方面存在困难,这表明模型规模的扩大并不总能克服这些瓶颈。