PulseAugur
中
实时 12:41:22
实体 ContractScrub

ContractScrub

PulseAugur coverage of ContractScrub — every cluster mentioning ContractScrub across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 1 条
  1. RESEARCH · CL_211975 ·

    新的ContractScrub基准测试揭示了LLM在法律合同审查中的弱点

    研究人员推出了ContractScrub,这是第一个专门用于评估大型语言模型(LLM)在合同审查能力方面的基准测试。这项任务涉及审查法律协议中的错误和不一致之处,由于其常规性和注重细节的性质,对于自动化至关重要。尽管LLM在长上下文推理和命名实体识别方面具有潜力,但前沿模型在此基准测试上的表现却出人意料地差,只有一个模型达到了0.75的宏平均召回率。这凸显了当前模型的局限性,以及需要进行特定领域的评估来衡量实际影响。