研究人员推出了ContractScrub,这是第一个专门用于评估大型语言模型(LLM)在合同审查能力方面的基准测试。这项任务涉及审查法律协议中的错误和不一致之处,由于其常规性和注重细节的性质,对于自动化至关重要。尽管LLM在长上下文推理和命名实体识别方面具有潜力,但前沿模型在此基准测试上的表现却出人意料地差,只有一个模型达到了0.75的宏平均召回率。这凸显了当前模型的局限性,以及需要进行特定领域的评估来衡量实际影响。 AI
影响 凸显了当前LLM在法律合同审查等专业领域的局限性,表明需要特定领域的基准测试和模型改进。
排序理由 该集群描述了一个用于评估LLM在特定任务上性能的新学术基准测试的推出。
在 Hugging Face Daily Papers 阅读 →
- alphaXiv
- arXiv
- CatalyzeX
- Connected Papers
- ContractScrub
- CORE Recommender
- DagsHub
- Gotit.pub
- Hugging Face
- Litmaps
- LLMs
- named-entity recognition
- ScienceCast
- scite Smart Citations
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →