一项名为InsufficiencyBench的新基准已被开发出来,用于评估法律AI系统处理不明确用户查询的能力。该基准包含202个条目,由执业律师在六个法律领域和24个美国司法管辖区进行标注,重点关注模型是否能识别缺失的法律相关信息、确定缺失内容以及避免过早下结论。对十个前沿模型的评估显示,在缺失要素识别方面,没有一个模型的F2分数超过0.46,中位召回率为0.44,这表明当前模型要么过度规避,要么做出无根据的假设。 AI
影响 突显了当前法律AI的关键局限性,表明需要模型能够更好地处理歧义并在提供建议前识别缺失信息。
排序理由 该集群包含一篇介绍AI系统评估新基准的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →