一个名为 WuYu-EnvLE-Bench 的新基准已被开发出来,用于评估大型语言模型(LLMs)在环境执法领域的处理能力。该基准源自真实案例和专家评审,包含 14 个任务和 12 个污染子领域的 2,521 个实例。初步评估显示,虽然 LLMs 在受规则约束的任务上表现良好,但在证据链构建和多源整合等复杂推理方面存在困难,这表明模型规模的扩大并不总能克服这些瓶颈。 AI
影响 该基准可以指导 LLMs 在专业法律和监管领域的开发应用,并突出显示在实际部署中需要改进的领域。
排序理由 该集群描述了一个用于在特定领域评估 LLMs 的新基准,该基准在一篇学术论文中发布。[lever_c_demoted from research: ic=1 ai=1.0]
- Absolute Environmental Enforcement Score
- arXiv
- Hugging Face
- Intelligent Enforcement Index
- Large language models
- WuYu-EnvLE-Bench
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →