PulseAugur
实时 13:39:47
实体 CAREBench

CAREBench

PulseAugur coverage of CAREBench — every cluster mentioning CAREBench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
  1. RESEARCH · CL_117880 ·

    新基准TSHA和CAREBench揭示LLM安全漏洞

    发布了两个新的基准来评估语言模型的安全能力。TSHA使用超过66,000个问答对,侧重于评估视觉语言模型在真实室内环境中识别安全隐患的能力。而CAREBench则专门针对语言模型,评估其识别明确滥用内容之外的上游儿童安全风险的能力,包含十二个类别的500个提示。这两个基准都突显了当前前沿模型在安全意识方面存在的显著不足。

  2. TOOL · CL_127607 ·

    新基准CAREBench评估AI儿童安全风险,超越明确的虐待内容

    研究人员开发了CAREBench,这是一个旨在评估大型语言模型儿童安全风险的新基准,超越了明确的虐待材料。该基准包含十二个类别(如诱骗、欺骗和情感依赖)的500个提示,并附有父母和临床医生的注释。对七个前沿模型的初步评估显示,失败率在2%到58%之间,凸显了当前AI儿童安全政策存在的重大差距。