研究人员开发了LexRubric,一个旨在评估大型语言模型(LLM)在开放式法律任务(尤其是在中文语境下)表现的新基准。该基准包含649个实例,涵盖法律咨询和司法考试,并辅以超过12,000条专家撰写的六个维度的评分标准。对18个LLM进行的初步测试显示,当前模型在处理这些复杂的法律推理任务时面临重大挑战,并突显了不同模型之间独特的能力特征。 AI
影响 强调了当前LLM在专业法律推理方面的局限性,表明需要进一步发展特定领域的AI能力。
排序理由 该集群描述了一篇介绍用于评估LLM在法律任务方面表现的基准的新学术论文。
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- LexRubric
- ScienceCast
- Standard Chinese
- Yifan Chen
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →