研究人员推出了ContractScrub,这是第一个专门用于评估大型语言模型(LLM)在合同审查(法律工作中一项关键任务)能力的基准。该基准由经验丰富的律师手工制作合同组成,涵盖了诸如定义术语误用和语言不一致等各种错误类别。尽管LLM有潜力自动化这项常规但艰巨的工作,但当前最前沿的模型表现却出人意料地差,只有一个模型达到了0.75的宏平均召回率,这凸显了进行领域特定评估的必要性。 AI
影响 凸显了通用LLM能力与专业领域任务之间的差距,表明法律科技领域需要更具针对性的基准。
排序理由 该项目是一篇研究论文,介绍了一个用于评估LLM在特定任务上表现的新基准。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- Connected Papers
- ContractScrub
- CORE Recommender
- DagsHub
- Gotit.pub
- Hugging Face
- Litmaps
- LLMs
- named-entity recognition
- ScienceCast
- scite Smart Citations
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →