实体
LexRubric
LexRubric
PulseAugur coverage of LexRubric — every cluster mentioning LexRubric across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
新的LexRubric基准揭示LLM在处理开放式法律任务方面存在困难
研究人员开发了LexRubric,一个旨在评估大型语言模型(LLM)在开放式法律任务(尤其是在中文语境下)表现的新基准。该基准包含649个实例,涵盖法律咨询和司法考试,并辅以超过12,000条专家撰写的六个维度的评分标准。对18个LLM进行的初步测试显示,当前模型在处理这些复杂的法律推理任务时面临重大挑战,并突显了不同模型之间独特的能力特征。
-
新基准LexRubric测试LLM处理中文法律任务的能力
研究人员开发了LexRubric,一个旨在评估大型语言模型在中国法律开放式任务上表现的新基准。该基准包含649个实例,涵盖法律咨询和司法考试,拥有超过12,000条专家编写的跨六个维度的评分标准。对18个LLM的初步测试显示了不同的能力特征,表明当前模型在复杂的法律推理方面仍有困难。