PulseAugur
实时 13:59:30
实体 TF-RefusalBench

TF-RefusalBench

PulseAugur coverage of TF-RefusalBench — every cluster mentioning TF-RefusalBench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_119599 ·

    新基准衡量大型语言模型在刑事法律任务中的过度对齐

    研究人员开发了TF-RefusalBench,这是一个新的多语言基准,旨在衡量和缓解大型语言模型(LLMs)在刑事法律特定背景下的过度对齐。该基准源自公开的瑞士最高法院判决,包含法语、德语、意大利语和英语的5,200个提示,涉及易于模型护栏激活的任务,如翻译和摘要。研究发现,过度对齐受模型和语言影响,其影响不仅限于简单的拒绝,还会影响任务的忠实度。研究评估了提示和消融拒绝方向等方法,其中消融在减少拒绝方面显示出有效性,同时对性能的影响最小。

  2. TOOL · CL_105129 ·

    新基准衡量刑事法律中大型语言模型的过度对齐

    开发了一个新的基准 TF-RefusalBench,用于衡量和减轻在多语言刑事法律环境中使用的大型语言模型 (LLM) 的过度对齐问题。该基准包含 5,200 个法语、德语、意大利语和英语的提示,源自公开的瑞士联邦最高法院裁决。研究人员发现,过度对齐受模型和语言的影响,其影响不仅限于简单的拒绝,还会影响任务的忠实度。研究还评估了缓解策略,表明虽然提示可以提供帮助,但消除拒绝指令的有效性仅会造成最小的性能下降。