PulseAugur
实时 17:23:17
English(EN) WuYu-EnvLE-Bench: A Benchmark for Evaluating Large Language Models in Environmental Law Enforcement

新基准评估大型语言模型在环境执法领域的处理能力

一个名为 WuYu-EnvLE-Bench 的新基准已被开发出来,用于评估大型语言模型(LLMs)在环境执法领域的处理能力。该基准源自真实案例和专家评审,包含 14 个任务和 12 个污染子领域的 2,521 个实例。初步评估显示,虽然 LLMs 在受规则约束的任务上表现良好,但在证据链构建和多源整合等复杂推理方面存在困难,这表明模型规模的扩大并不总能克服这些瓶颈。 AI

影响 该基准可以指导 LLMs 在专业法律和监管领域的开发应用,并突出显示在实际部署中需要改进的领域。

排序理由 该集群描述了一个用于在特定领域评估 LLMs 的新基准,该基准在一篇学术论文中发布。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新基准评估大型语言模型在环境执法领域的处理能力

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Ziliang Yang, Yi Zhang, Kaijun Lin, Jiachao Ke, Haihong Xu, Zongguo Wen ·

    WuYu-EnvLE-Bench:一个用于评估大型语言模型在环境执法领域表现的基准

    arXiv:2607.17745v1 Announce Type: new Abstract: Large language models (LLMs) are increasingly considered for environmental enforcement, but their ability to produce traceable enforcement decisions remains unclear. We introduce WuYu-EnvLE-Bench, a benchmark built from real enforce…