PulseAugur
实时 14:29:36
English(EN) CAREBench: A Child-Safety Risk Benchmark for Language Models

新基准TSHA和CAREBench揭示LLM安全漏洞

发布了两个新的基准来评估语言模型的安全能力。TSHA使用超过66,000个问答对,侧重于评估视觉语言模型在真实室内环境中识别安全隐患的能力。而CAREBench则专门针对语言模型,评估其识别明确滥用内容之外的上游儿童安全风险的能力,包含十二个类别的500个提示。这两个基准都突显了当前前沿模型在安全意识方面存在的显著不足。 AI

影响 这些基准将推动AI安全评估的改进,促使模型更好地识别和减轻现实场景中的风险。

排序理由 在arXiv上发布了两篇学术论文,介绍了用于评估AI安全的新基准。

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →

新基准TSHA和CAREBench揭示LLM安全漏洞

报道来源 [2]

  1. arXiv cs.AI TIER_1 English(EN) · Qiucheng Yu, Ruijie Xu, Mingang Chen Jianfeng Dong, Xin Tan ·

    TSHA:可信安全危害评估场景下的视觉语言模型基准

    arXiv:2603.29759v2 Announce Type: replace-cross Abstract: Recent advances in vision-language models (VLMs) have accelerated their application to indoor safety hazards assessment. However, existing benchmarks suffer from three fundamental limitations: (1) heavy reliance on synthet…

  2. arXiv cs.LG TIER_1 English(EN) · Kaavya Krishna-Kumar, Elaine Lau, Vaughn Robinson, Jay Caldwell, Sheriff Issaka, Skyler Wang, Francisco Guzm\'an, Steven Kelling, Jonas Mueller ·

    CAREBench:语言模型的儿童安全风险基准

    arXiv:2606.29685v1 Announce Type: new Abstract: How can we evaluate whether frontier AI systems recognize child-safety risks before they escalate into explicit harm? Existing child safety evaluations focus on child sexual abuse material, yet many child-safety failures begin earli…